谢赛宁团队联手谷歌,揭秘扩散模型新突破
划时代的突破出现了!纽约大学、麻省理工学院和谷歌的顶级研究团队一起合作,给扩散模型带来了一种全新的思路——测试时的Scaling Law计算方法。谢赛宁的得意门生在这个研究中也是共同的一作作者。
测试时计算+扩散模型,终于有人做到了!
谢赛宁的AI团队这次又搞了个大新闻,作品火得不要不要的。
大家知道,OpenAI坚信,测试大模型的时候,计算量是个新规律。而o3的表现就像是用实力证明了这一点。
那么,扩散模型(DM)又如何呢?
最近,纽约大学、麻省理工学院和谷歌的研究人员联手,带来了一种全新的方法。他们打造了一个通用的搜索框架,旨在从两方面加强模型的效率。
一方面,我们用验证器来给出对质量的评价,另一方面,我们还弄了个特别算法,去找那些更好的噪声候选。
简单来说,验证器算法是确保扩散模型测试中Scaling Law能顺利实施的关键。
谢赛宁说,2025年嘛,扩散模型的发展有两个特别吸引人的趋势,要么是特别小巧,要么是特别庞大。
扩散模型在测试时也有遵循的“扩缩定律”。
那么,我们在测试扩散模型的时候,真的能从计算中观察到全新的比例定律吗?
看大佬的微博,能迅速抓住要点。
谢赛宁发了个长文章,说头一回见扩散模型那玩意儿,觉得它在推理方面的变化能力太让人惊讶了。
不过,这是在o1出现之前的事了。
可是,这么弄的话,有个明显的问题——等到去噪做得太多以后,效果就差得多了,提升不明显了。
Nanye Ma和同事们一起,在这项研究里把推理中的Scaling(缩放)重新理解成了寻找采样噪声的过程。
研究发现,多花点时间在搜索计算上,能让生成效果更好,这样就能让扩散模型变得更强大。
扩散模型呢,它特别灵活,就像做菜一样,你可以在推理的时候,通过改变去掉杂音的次数,来决定用多少算力。
可是,因为误差越积越多,再加去噪步骤后,效果提升很快就到头了,就像到了一个顶点。
所以啊,要让扩散模型在推理的时候能做得更大,我们得弄个新的框架出来。
听说了没,这叫“优选效应”,就是说在挑东西的时候,那些一开始看起来不那么完美的东西,后来表现反而挺出色的。
也就是说,我们可以用更多的计算力量去寻找更出色的噪声,这样就能打破推理阶段在规模上的限制。
那得怎么分辨哪些采集的杂音更合适呢?还有,怎么才能高效地找到这些好的杂音呢?
所以呢,这个团队弄了个搜索方法,分两步走:一个负责给意见,另一个负责找更好的噪声选项。
在用SiT-XL这个工具测试ImageNet数据集时,不同的验证器和算法搭配起来,它们在性能提升上的效果差别挺大的。
然后,这个团队探讨了搜索工具在制作根据特定条件生成的文字方面的表现如何。
用这个12B FLUX.1-dev模型在DrawBench上,要是把所有验证器都搭在一起找东西,样本能做得更好看。不过,这种做法在不同配置下,效果差别挺大的。
看这些发现嘛,就是说啊,没有一个通用的搜索设置能搞定所有事;实际上,得根据每项任务来定制搜索配置,才能达到最好的效果。
最后,这个团队探讨了在推理过程中,通过调整计算规模,小型的扩散模型能得到什么好处。
在ImageNet这个大图库测试中,SiT-L模型在不用太多计算资源的情况下比SiT-XL模型表现更好;而在将文字变成图片的任务里,那个只有0.6亿参数的PixArt-Sigma模型,它的总计算需求只有FLUX.1-dev模型的一个零头,但效果却更出色。
这意味着,我们虽然花了好多钱去训练,但只要在推理的时候稍微多花点计算功夫,就能在一定程度上节省那些成本,还能得到更好的样本。
好的,那就让我们一块儿来读读这篇作品。
「事半功倍」不行,那就开辟新路
就像开头提到的,这个新的搜索系统主要有两个核心部分:一个负责在搜索过程中给出评价的检查工具,另一个则是用来找到更优噪声选项的智能算法。
总而言之,最新研究的贡献主要有三大点:
这个项目的网站在这,大家可以看看:[点击这里访问](https://inference-scale-diffusion.github.io/)。
将推理时Scaling作为搜索问题
研究人员把推理过程中的Scaling(调整)看作是寻找合适采样噪声的过程。他们得找出哪些噪声是有用的,然后再去寻找这些有用的噪声。
他们从更高的角度出发,提出了要考虑两个设计方向。
1. 验证器这类预训练模型能评估噪声候选项的质量,简单来说,就是它们接收到生成的样本和可能的相关条件,然后对每个样本给出一个评分。
2. 算法,就是那种根据验证器给出的意见,去挑选更优的噪声候选者的工具。简单来说,算法就是一个函数。
这个函数主要是用来处理验证器V、之前训练好的扩散模型D_θ以及N组生成的图像和它们的相关信息。它通过分析噪声和图像之间的固定关系,来计算并给出最合适的初始噪声值。
在搜索的全过程中,f函数得反复对D_θ做好几次向前推算。
研究者把那些多出来的向前计算过程称作是搜索成本,并且用NFE这个指标来衡量它们。
在进行这个展示的ImageNet分类生成任务时,专家们用好了在ImageNet-256上已经练好的SiT-XL模型,还用了二阶Heun采样器来帮忙做数据抽样。
他们通过去噪步骤和搜索时用的总NFE来评估推理的计算成本。去噪这一步是固定的,设置为最理想的250次,重点分析的是搜索过程中NFE这个参数如何随着任务规模的变化而变化。
验证器
在验证器这块,研究人员研究了三种不一样的型号,主要是为了模仿三种不同的实际应用场景。
1. 预言验证器:就是用选定的样本来最终检查那些完整的权限信息。
研究显示,尽管这个预测检查工具挺管用,但真要用在现实生活中就不太方便了,因为它得彻底看到样本最终的评判结果。
这些研究只把成果当做一个初步的展示,想说明把计算力用在搜索上,真的能让人工智能的表现变得更好,而且处理信息的能力也能大幅提升。
2. 监督验证器这东西,能利用那些已经训练好的模型来检查样本的好坏,还能看样本是否符合特定的要求。
研究人员挑了俩能好好学习的模型,一个叫CLIP,一个叫DINO,然后用它们来看分类的事情。
在找东西的时候,他们会把样本放进这些分类器里,然后挑出那个类别标签对应的最高得分(logits值)的样本来用。
尽管多加去噪步骤来拓展NFE的效果比单纯这样做要好,能更好提升样本的IS得分,但是作者用的那个分类器还有FID分数的目标,它们只是差不多一致,因为它们都是一点一点来比较的,没考虑到样本的整体统计数据。
这种情况会让样本的波动变小,就像计算越来越多的时候,我们发现自己找对的东西越来越多,但是能找到的东西却越来越少,这个变化可以从我们越来越准确的判断和越来越低的找回率里看到。
3. 自监督验证器,它是通过比较低噪声程度(σ=0.4)和无噪声(σ=0.0)的样本在DINO/CLIP提取出的特征空间中的余弦相似度,来对噪声初始质量进行评估。
研究发现,这种相似度分数跟DINO/CLIP分类器给出的logits关系很紧密,所以它能够很好地替代那个监督验证器。
算法
在算法研究上,专家们还琢磨了三种不一样的办法。
这张图6展示了这些算法的工作效果。零阶搜索和路径搜索这两种方法因为它们的特点,多少能减轻FID多样性的问题,并且还能保持Inception Score这种评分方法的平衡性。
文本-图像推理时Scaling
作者打算再探索一下,看搜索框架在处理更大堆文本生成的任务时,推理能力能不能扩大。同时,他还想看看验证器能不能和特定图像生成的工作好好配合。
为了更好地检验这个框架,研究者们挑选了两组数据集来进行测试,分别是DrawBench和T2I-CompBench。
作者在构建模型的时候,选用了最近推出的FLUX.1-dev模型来当主要的核心部分。
分析结果:检查验证器Hacking和验证器-任务是否匹配
看图8就能明白,按照LLM评分器的建议,把所有验证器都加入搜索流程,一般能提升样本的质量。不过,这种提升在不同配置下具体效果有差异。
这说明作者的观点是对的,就是我们得根据用到的地方不一样,挑着合适的搜索设置来用。
用FLUX.1-dev这玩意儿来推理,看看它搜索的能力怎么样
在图9里,作者发现随着投入的搜索预算越来越多,那些评估指标的增长趋势和ImageNet的情况挺像的。
看这些验证器在DrawBench和T2I-CompBench上的表现对比,发现有的验证器可能更适合干某些特定的事情。
这事儿让作者有了新想法,打算弄出更多专用的检查工具来。接下来,他们还得继续研究呢。
下面这张表里,作者对比展示了两种搜索算法在DrawBench测试平台上的效果。
研究发现,这三种方式都能把采样做得更好,而在某些地方,随机搜索比另外两种做得更好一些。这主要是因为零阶搜索和路径搜索容易只看眼前的情况,不太能发现更广阔的天地。
搜索与微调兼容性
搜索和微调都是为了使最后得到的样本,更好地符合那些明确的奖励模型或者人们的喜好。
一个做法是把测试出来的数据往验证器喜欢的那一边调整,另一个做法则是直接调整模型的分布,让它更符合奖励的标准。
这就带出了一个疑问:要是模型分布给动了,我们还能不能靠验证器来调整样本的表现模式呢?
作者对Stable Diffusion XL模型进行了DPO微调,然后在DrawBench数据集里进行了查找。
因为这个模型是在Pick-a-Pic数据集上进行了调整,所以研究人员换用了PickScore来评估,不再用ImageReward了。
表格3显示了,研究者们发现,这种搜索技巧不仅适用于各种模型,还能提高那些已经调整好的模型的效果。这玩意儿将来可派上大用场,能帮我们做这些事情:
推理计算投入的维度
因为扩散模型在一次次采样过程中有这个特点,所以在找东西的时候,作者就能在不同方向上把电脑算力的分配给弄得更合理。
接下来,我们把这几个方面给列出来,然后看看它们是怎么影响我们搜索结果的。
计算投入的有效性
而且,他们还研究了在小规模扩散模型上进行推理时,计算量的实际效果,并且指出这种方法相比那些没采用搜索的大块头模型来说,在性能上更加高效。
在处理ImageNet这个任务时,他们用到了SiT-B和SiT-L这两种方法。而在做文本转图像的工作时,除了FLUX.1-dev之外,他们还用了一个比较小巧的、基于Transformer的模型,叫PixArt-ΣΣ。
因为模型大小不一,每次计算前向传播的花费差别很大,所以他们用估算的GFLOPs来衡量计算费用,而不是用NFEs。
看图11就能明白,用小模型在ImageNet上做推理,算力的调整挺管用。就是那种预算有限、地方算力不够的地方,用SiT-L模型的效果能比SiT-XL强。
但是,这事儿得让小模型先得有个不错的底子,SiT-B在搜索里赚的比SiT-L要少,而且也没在计算区域上占到便宜。
研究还发现,在文本条件设定方面,表4的数据显示,PixArt-ΣΣ只用了一小部分计算资源,就比没有进行搜索的FLUX-1.dev表现得更好。而且,当计算量增加了一倍左右的时候,PixArt-ΣΣ的表现更是明显地超过了没有使用搜索功能的FLUX.1-dev。
这研究成果对实际应用很有帮助:训练阶段需要用很多计算资源,但生成样本时只需要很少的计算,这样一来,我们就能更快速地获得更好的样本。
作者介绍
Willis (Nanye) Ma
Nanye Ma在纽约大学读博,指导老师是谢赛宁,而且他还是谷歌的研究实习生。之前,他在NYU读完了数学和计算机两个专业的本科学位。
他主要研究用人工智能来制作视频,专注于提升隐藏表示和保持视频长时间连续性。他的兴趣还涉猎到计算机视觉的多个方面,特别关注在生成模型中寻找最佳的传输方法。
除了搞学术,他平时还爱打篮球、去徒步、滑雪还有拍拍照。
Shangyuan Tong
Shangyuan Tong是麻省理工学院CSAIL的研究生,他的导师是Tommi S. Jaakkola。之前,他在UCSD读完本科。
他的研究方向为深度学习和生成模型。
