一种选取扩散模型的中间变量的方法

本发明涉及神经网络,具体来说涉及扩散模型领域,更具体地说,涉及一种选取扩散模型的中间变量的方法。
背景技术:
1、扩散模型(diffusion model)[1][2]是一种较为新兴的生成式模型,主要用于图像生成。目前常用的扩散模型具有这样的结构:从整体来看,用扩散模型生成图像是一个逐步执行的过程,从完全的高斯噪声开始逐步去除噪声,最终得到输出图像;更具体来看,每一步去除噪声,都借助一个u-net骨干神经网络[3]完成,该神经网络接受当前步骤上的部分带噪图像和一个通常以文本形式给出的控制条件,并预测出需要在当前步骤去除的噪声。
2、近来,有研究者发现,训练好的扩散模型可以用于提取图像表征[4]。具体而言,先向需要转换为表征的图像加入部分噪声,然后将带噪声的图像与文本控制条件一起输入到扩散模型的u-net中,令其完成一步噪声预测,这一过程中,u-net内部会产生一些中间变量,将这些中间变量收集起来即可作为表征使用。这种图像表征的用法十分灵活,只要原本的某个判别任务是直接接受原始图像输入,并通过某种模型完成类别预测、语义分割等任务,那就可以用预训练扩散模型提前将原始图像转换为信息更丰富的表征,并用这些表征代替原本的图像输入判别模型。
3、更具体而言,u-net的中间变量很多,它们对应的图像表征的质量不一,仍需要从中选择出质量较高的少数中间变量作为最终的扩散表征。这个选择过程通常通过定量比较实现,也就是将各个候选项单独视为扩散表征,执行某个具体的数据集上的判别任务,比较各个候选项在这个任务上的性能,并选择性能最高的若干候选项[4][6]。
4、当前主流的扩散模型[2][5]所使用的u-net实际上较为复杂,包含了视觉transformer(vit模块)[7]、残差模块[8]、上/下采样模块等模块,如图1所示,部分模块包含了更为复杂的内部结构。然而,现有的扩散表征方法[4][9][10]选用扩散模型的表征的方式较为单一,所选表征的质量欠佳,影响后续任务的性能,有进一步改进的空间。
5、一些现有技术的信息如下:
6、[1]jonathan ho,ajay jain,and pieter abbeel.denoising diffusionprobabilistic models.advances in neural information processing systems,33:6840–6851,2020.
7、[2]robin rombach,andreas blattmann,dominik lorenz,patrick esser,andbj¨orn ommer.high-resolution image synthesis with latent diffusion models.inproceedings of the ieee/cvf conference on computer vision and patternrecognition,pages 10684–10695,2022.
8、[3]olaf ronneberger,philipp fischer,and thomas brox.u-net:convolutional networks for biomedical image segmentation.in medical imagecomputing and computer-assisted intervention–miccai 2015:18th internationalconference,munich,germany,october 5-9,2015,proceedings,part iii 18,pages 234–241.springer,2015.
9、[4]dmitry baranchuk,andrey voynov,ivan rubachev,valentin khrulkov,andartem babenko.label-efficient semantic segmentation with diffusion models.ininternational conference on learning representations,pages 1–15,2021.
10、[5]dustin podell,zion english,kyle lacey,andreas blattmann,timdockhorn,jonas müller,joe penna,and robin rombach.sdxl:improving latentdiffusion models for high-resolution image synthesis.corr,abs/2307.01952,2023.
11、[6]grace luo,lisa dunlap,dong huk park,aleksander holynski,and trevordarrell.diffusion hyperfeatures:searching through time and space for semanticcorrespondence.in annual conference on neural informationprocessing systems,2023.
12、[7]alexey dosovitskiy,lucas beyer,alexander kolesnikov,dirkweissenborn,xiaohua zhai,thomas unterthiner,mostafa dehghani,matthiasminderer,georg heigold,sylvain gelly,jakob uszkoreit,and neilhoulsby.an image is worth 16x16 words:transformers for image recognition atscale.in 9th international conference on learning representations,2021.
13、[8]kaiming he,xiangyu zhang,shaoqing ren,and jian sun.deepresiduallearning for image recognition.in ieee conference on computervision andpattern recognition,pages 770–778,2016.
14、[9]wenliang zhao,yongming rao,zuyan liu,benlin liu,jie zhou,and jiwenlu.unleashing text-to-image diffusion models for visual perception.in ieee/cvf international conference on computer vision,pages 5706–5716,2023.
15、[10]jiarui xu,sifei liu,arash vahdat,wonmin byeon,xiaolong wang,andshalini de mello.open-vocabulary panoptic segmentation with text-to-imagediffusion models.in ieee/cvf conference on computer vision andpatternrecognition,pages 2955–2966,2023.
16、[11]robin rombach,andreas blattmann,dominik lorenz,patrick esser,andbj¨orn ommer.high-resolution image synthesis with latent diffusionmodels.inproceedings of the ieee/cvf conference on computer vision andpatternrecognition,pages 10684–10695,2022.
17、[12]olaf ronneberger,philipp fischer,and thomas brox.u-net:convolutional networks for biomedical image segmentation.in medicalimagecomputing and computer-assisted intervention–miccai 2015:18thinternational conference,munich,germany,october 5-9,2015,proceedings,partiii 18,pages 234–241.springer,2015.
18、[13]dmitry baranchuk,andrey voynov,ivan rubachev,valentinkhrulkov,andartem babenko.label-efficient semantic segmentation withdiffusion models.ininternational conference on learning representations,pages 1–15,2021.
19、[14]dustin podell,zion english,kyle lacey,andreas blattmann,timdockhorn,jonas müller,joe penna,and robin rombach.sdxl:improvinglatentdiffusion models for high-resolution image synthesis.corr,abs/2307.01952,2023.
20、[15]mathilde caron,ishan misra,julien mairal,priya goyal,piotrbojanowski,and armand joulin.unsupervised learning of visual featuresbycontrasting cluster assignments.in annual conference on neuralinformationprocessing systems,2020.
21、[16]robin rombach,andreas blattmann,dominik lorenz,patrick esser,andommer.high-resolution image synthesis with latent diffusion models.inieee/cvf conference on computer vision and pattern recognition,pages10674–10685,2022.
22、[17]rombach.sdxl:improving latent diffusion models for high-resolution image synthesis.corr,abs/2307.01952,2023.
23、[18]https://huggingface.co/playgroundai/playground-v2-1024px-aesthetic
24、[19]dmitry baranchuk,andrey voynov,ivan rubachev,valentinkhrulkov,andartem babenko.label-efficient semantic segmentation withdiffusion models.inthe tenth international conference on learningrepresentations,2022.
25、[20]kaiming he,xinlei chen,saining xie,yanghao li,piotr dollár,andross b.girshick.masked autoencoders are scalable vision learners.inieee/cvfconference on computer vision and pattern recognition,pages15979–15988,2022.
26、[21]mathilde caron,ishan misra,julien mairal,priya goyal,piotrbojanowski,and armand joulin.unsupervised learning of visual features bycontrasting cluster assignments.in annual conference on neural informationprocessing systems,2020.
27、需要说明的是:本背景技术仅用于介绍本发明的相关信息,以便于帮助理解本发明的技术方案,但并不意味着相关信息必然是现有技术。相关信息与本发明方案一同提交和公开,在没有证据表明相关信息已在本发明的申请日以前公开的情况下,相关信息不应被视为现有技术。
技术实现思路
1、因此,本发明的目的在于克服上述现有技术的缺陷,提供一种选取扩散模型的中间变量的方法。
2、本发明的目的是通过以下技术方案实现的:
3、根据本发明的第一方面,提供一种选取扩散模型的中间变量的方法,包括:选取扩散模型中模块间的中间变量作为候选项,以及选取扩散模型中vit模块内部的中间变量作为候选项,形成候选集合;针对候选集合中的每个候选项进行定量评价,包括:在训练和测试图像预测模型时,利用候选项对应的扩散表征代替原始图像作为图像预测模型的输入,并在训练完成后基于测试指标评价候选项的性能,其中,候选项对应的扩散表征是指将原始图像输入扩散模型后在候选项对应中间变量处得到的图像特征;从候选集合中,按性能由优到劣的顺序,选择部分候选项为选定项。
4、可选的,按照以下方式形成候选项集合:获取参考图像,将参考图像输入扩散模型,得到模块间的中间变量提供的参考扩散表征以及vit模块内部的中间变量提供的参考扩散表征;利用主成分分析算法,将所有的参考扩散表征的尺度进行统一,转换为三通道表征,每个三通道表征对应一个中间变量;将三通道表征视为rgb图像,向用户进行可视化展示;由用户根据展示的rgb图像选取三通道表征,依据选取的三通道表征与中间变量的对应关系,得到相关的候选项,形成候选集合。
5、可选的,扩散模型是基于u-net架构且含vit模块的模型,候选集合中的候选项包括:扩散模型在上采样阶段的前半部分的以下中间变量:模块间的中间变量、跨模态注意力层的查询向量、vit模块的基本块的输出;候选集合中的候选项不包括扩散模型在下采样过程的所有中间变量。
6、可选的,候选集合中的候选项还包括:
7、扩散模型在上采样阶段的后半部分的以下中间变量:自注意力层的查询向量和键向量。
8、可选的,每个候选项的性能按以下方式评价:获取第一数据集,将第一数据集中每个样本图像输入扩散模型,得到候选项对应的扩散表征,用该扩散表征代替对应的样本图像,形成该候选项的第一替代数据集;从第一替代数据集中提取第一训练集和第一测试集;为每个候选项分别构建图像预测模型,利用每个候选项的第一训练集训练该候选项对应图像预测模型,得到经训练的图像预测模型;利用第一测试集评价经训练的图像预测模型的测试指标,根据测试指标确定该候选项的性能。
9、可选的,该方法还包括:利用不同预测任务对应的第一数据集分别对每个候选项的性能进行评价,在每个预测任务下分别选择一个或者多个候选项作为选定项。
10、根据本发明的第二方面,提供一种训练图像分割模型的方法,包括:获取按照第一方面的方法确定的选定项;获取图像分割任务的第二数据集,其包括多个样本,每个样本包括样本图像和标签,标签指示对应样本图像中每个像素的类别;利用扩散模型和选定项提取图像对应的融合表征,包括:将第二数据集中每个样本图像输入扩散模型,得到每个选定项对应的扩散表征,将所有选定项对应的扩散表征进行融合,得到样本图像对应的融合表征;用融合表征代替第二数据集中对应的样本图像,形成该选定项的第二替代数据集;从第二替代数据集中提取第二训练集;利用第二训练集训练图像分割模型根据融合特征对图像进行分割,根据分割结果、标签和损失函数更新图像分割模型的参数,以最小化损失函数值,其中,该图像分割模型的输入尺度等于融合特征的尺度,输出尺度等于样本图像的尺度。
11、根据本发明的第三方面,提供一种图像分割方法,包括:获取待分割图像,利用扩散模型和选定项提取待分割图像对应的融合表征;将待分割图像对应的融合表征输入按照第二方面的方法训练得到的图像分割模型,得到待分割图像对应的分割结果。
12、根据本发明的第四方面,提供一种电子设备,包括:一个或多个处理器;以及存储器,其中存储器用于存储可执行指令;所述一个或多个处理器被配置为经由执行所述可执行指令以实现第一、第二和/或第三所述方法的步骤。
技术研发人员:许倩倩,孟本源,王子泰,操晓春,黄庆明
技术所有人:中国科学院计算技术研究所
备 注:该技术已申请专利,仅供学习研究,如用于商业用途,请联系技术所有人。
声 明 :此信息收集于网络,如果你是此专利的发明人不想本网站收录此信息请联系我们,我们会在第一时间删除
