展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 南洋理工大学让AI图像生成"只看有用的部分"

南洋理工大学让AI图像生成"只看有用的部分"

南洋理工大学提出频谱强制方法,在扩散模型训练中动态屏蔽被噪点淹没的高频信息,仅保留有用部分。该方法不修改训练流程,计算量仅增0.5%。在ImageNet上FID降低14.5%,训练时间节省17%-33%,适用于粗分块的自然图像生成。

这项由南洋理工大学S-Lab实验室主导的研究,以预印本形式发布于2026年6月。

说到AI生成图片,多数人想到的是那种能凭空“画”出逼真风景、人像乃至奇幻场景的神奇模型。这些模型背后,有个核心技术叫“扩散模型”——它工作的方式有点像:先把一张清晰的照片慢慢往里加入噪点,直到变成一片雪花屏,再反过来训练AI学会从雪花屏里“还原”出清晰照片。

然而,南洋理工大学的这支研究团队发现了一个长期被忽视的浪费现象:AI在“去噪”的过程中,相当一部分计算力其实花在了毫无意义的地方。更关键的是,他们不仅发现了问题,还提出了一个几乎不需要额外计算资源、也不改动任何核心训练流程的修复方案,并将其命名为频谱强制(Spectral Forcing,简称SF)。

一、AI画图时究竟在“看”什么?一个关于噪音与信号的故事

要理解这项研究解决的是什么问题,得先理解AI在训练时面对的处境。

以“矫正流扩散”这种主流训练方式为例,AI在每一个训练时刻,看到的是一张“半成品图”——它介于纯粹的随机噪点和清晰的原始照片之间。时刻越靠近起点(纯噪点),图像越模糊混乱;越靠近终点(清晰照片),图像越接近真实。AI的任务,就是在每个时刻预测“应该往哪个方向走,才能得到真实图像”。

自然界的图片有一个普遍规律:图像中的细节(高频信息,比如纹理、边缘锯齿)天然比粗略轮廓(低频信息,比如大块颜色、整体形状)携带的能量少得多。用声音来类比,低频就像低沉的鼓声,穿透力强、能量大;高频就像细碎的沙沙声,微弱易被淹没。

当噪点被加入图像时,这种微弱的高频细节信息极其容易被噪点“盖住”。研究团队通过数学推导得出一条清晰的界线:在任何给定的训练时刻,图像中那些频率超过某个临界值的细节,实际上已经完全被噪点淹没,根本提取不出任何有关原始图像的信息。这条临界线可以用一个公式精确描述,它随着训练时刻向“清晰照片”方向推进而不断扩展,允许越来越多的细节频率露出水面。

这本是个中性的物理事实。但问题在于:AI并不“知道”这条界线的存在。它在每个时刻都得同时处理图像的所有频率,包括那些已经被噪点完全覆盖、根本不含有用信息的高频部分。

二、被浪费的计算力:AI在“学习”毫无意义的东西

研究团队为了证实这个猜测,做了一个直觉上简单却相当有说服力的实验。他们训练了一个小型AI模型,让它在合成数据上充分学习,然后检查这个模型在每个“时刻-频率”组合上的表现:AI的预测比起“什么都不做、直接输出零”的最简单基线,到底好多少?

结果呈现出一幅清晰的地图,如同一个楔形区域。在低频、以及训练时刻靠近清晰图像的区域,AI确实在做有价值的工作——它学到了数据的真实分布,能比“啥也不预测”的方案强得多。但在高频、以及时刻靠近噪点的区域,出现了两种情况:要么AI的预测退化成了一个固定的数学公式(因为噪点覆盖了信号,AI只能机械地“去掉噪点”,和数据本身无关);要么AI的预测甚至不如最简单的基线。换句话说,AI把大量计算资源花在了两类没有意义的事情上:一类是解一道固定方程,另一类是连方程都没解好。

更有说服力的是,研究团队把同样的检验方法用在一个真实的、在ImageNet数据集(一个包含大量真实照片的标准测试集)上训练的大型模型上,同样清晰地发现了这个“楔形结构”——那些高频、早期时刻的区域,AI的表现甚至不如零预测基线。浪费计算力的现象不只是理论预测,而是真实存在于实际模型中的。

三、频谱强制:一把随时间伸缩的“低通滤镜”

既然问题已经找到,解决方案就顺理成章了:能不能在每个训练时刻,直接把那些被噪点覆盖、毫无价值的高频信息屏蔽掉,只让AI看到真正有用的部分?

研究团队的答案就是频谱强制。它的工作原理可以用一个滤镜来理解。在摄影中,低通滤镜会让图像变得柔和,滤掉细碎的噪点和锐利边缘,只保留整体颜色和轮廓。频谱强制做的事情与此类似,但有两个关键差异:第一,它基于数学上严格推导出的“有用信号界线”来设定滤镜的截止点;第二,这个截止点会随着训练时刻动态变化——在靠近噪点的时刻,截止点很低,只让极少量低频信息通过;随着时刻向清晰图像推进,截止点不断扩大,让越来越多的频率进入,直到在最终时刻完全取消滤镜,让AI看到完整图像。

技术上,这个滤镜使用二维离散余弦变换(2D-DCT)来实现——这是一种把图像“分解”成不同频率成分的数学工具,与JPEG图片压缩背后的技术同出一脉。具体流程是:在每个训练步骤中,先把当前时刻的含噪图像做DCT变换,然后用一个软性的圆形遮罩把超出截止半径的高频系数乘以接近零的权重,最后做逆变换还原成图像,再送入AI模型。整个操作不引入任何可学习的参数,计算量约为总训练成本的0.5%,而且完全不改动训练损失函数、采样器或任何其他组件。

截止点的变化曲线(即“调度方案”)是另一个重要的设计选择。研究团队测试了多种方案:线性增长、平方增长、余弦曲线增长,以及直接从理论公式推导出的“解析方案”。线性方案最简单,就是截止点随时间均匀扩大;解析方案则完全跟随理论预测的信号界线移动。在实验中,线性方案在ImageNet的标准设置下表现最好,而解析方案在更高分辨率的场景中优势明显——这背后的原因,后文会详述。

四、什么情况下有效,什么情况下会适得其反

频谱强制不是万能药。研究团队花了大量篇幅清晰界定了它的适用边界,这种诚实是这项研究最值得称道的地方之一。

核心结论可以用一句话概括:频谱强制在两个条件同时满足时效果最好。第一,AI处理图像的方式是“粗粒度分块”(即把图像切成较大的方块作为输入单元,导致模型本身就已经看不到太多高频细节);第二,图像的高频内容主要是噪点而非有价值的信号。

为了验证这两个条件,研究团队做了一系列精心设计的对照实验,使用了三种合成数据集:一种是模拟自然图像统计规律的“幂律”数据(高频内容少,符合自然图像规律);一种是包含大量清晰边缘的“矩形”数据(高频内容是真实的边缘信号,至关重要);一种是混合了多种结构的“结构化”数据。

实验结果非常清晰:在幂律数据上,频谱强制显著改善了AI的学习效果;在矩形数据上,频谱强制反而伤害了模型——因为它屏蔽的高频内容正是矩形边缘,是AI必须学习的关键信号;在结构化数据上,效果介于两者之间,线性方案接近中性。

同样,在分块大小的实验中,当每张图像被切成1024个小块时(块很小,每块包含更多细节),频谱强制的收益最高,改善幅度达到70%;当每张图像只被切成16个大块时(块很大,每块已经平均掉了大量细节),效果反而略微下降。这说明,当AI的输入已经因为分块方式而“看不到”高频细节时,频谱强制额外屏蔽这些已经不存在的信息意义不大;但当AI确实在处理高频信息时,显式告诉它“现在这些频率都是噪点,别浪费精力”就很有价值。

五、在真实数据集上的表现:数字会说话

理论和合成实验已经很有说服力,但最终的检验还是得放到真实数据上。研究团队选择了ImageNet-256作为测试场景,使用的模型框架是“JiT”(一种像素空间扩散模型架构)。

在最有代表性的配置下,即使用JiT-700M/32(7亿参数规模,每张256×256的图像被切成64个图块),仅训练60个轮次,加入频谱强制后,FID分数(衡量生成图像质量的指标,数值越低越好)从24.19降到了20.68,提升幅度达14.5%;初始分数(衡量生成图像多样性和清晰度,越高越好)则从83.28提升到93.96,提升幅度约13%。这一对比是在完全相同的训练配置下进行的,唯一的变量就是是否启用频谱强制。

更能说明问题的是训练效率:加入频谱强制后,训练60个轮次就能达到原本需要约90个轮次才能达到的图像质量,训练120个轮次就能达到原本约145个轮次的水平。这意味着在实际使用中,可以节省约17%到33%的训练时间,而硬件成本几乎没有增加。

在更大的训练预算下,到120个轮次时,加入频谱强制的模型FID达到15.15,不仅比同样轮次的基线(16.46)强,还已经超过了此前使用类似架构训练约145个轮次的参考结果。

在较小的模型上,频谱强制在早期训练阶段(15个轮次时改善11.6%)优势最明显,随着训练深入,差距逐渐收窄,到200个轮次时仍保持约1.5%的优势。这个模式说明,频谱强制带来的部分收益来自“更快入门”,但也有一部分是稳定存在的长期改善。

当分块数量增加到256个时,频谱强制的效果缩减到2.2%左右,基本在统计误差范围内。这完美对应了理论预测:更细的分块让AI本身就能看到更多高频细节,此时频谱强制的贡献有限,但也不会造成伤害。

研究团队还对比了多种可能的替代方案。恒定的低通滤镜(不随时间变化)反而比基线更差,因为它永久屏蔽了某些频率,导致AI永远无法学习生成那些高频细节;空间域的高斯模糊效果更差;在损失函数上做频率加权(而非在输入上做滤镜)也明显不如频谱强制。

六、线性方案为何在ImageNet上胜过理论最优方案?

研究团队对这个看似反直觉的发现给出了详细的解释,读来颇有启发。

解析方案在小分辨率合成数据上比线性方案强2到3倍,但在ImageNet的256×256标准设置、64个图块的配置下反而输给了线性方案。原因有三点:

首先,理论公式中使用的“幂律指数”是对自然图像整体频率分布的一个全局拟合值,但真实图像在极高频率段的能量下降速度比全局拟合更快(因为相机传感器噪点、抗混叠处理等因素),导致理论公式对高频部分的处理过于激进,把本来还有一点用的频率也屏蔽掉了。

其次,在64个图块的配置下,图像分块本身就已经截断了大量高频信息,解析方案的早期极度保守(截止点长时间停在最低值附近)会让AI长时间看不到足够多的有效信息,影响梯度质量。

第三,解析方案中截止点的增长速度在训练早期非常缓慢,导致大部分训练时间内AI能看到的频率范围极其有限,学习效率受损。这三个问题在更高分辨率时都会得到缓解,所以在高分辨率玩具实验中解析方案反而更优。

研究团队的结论是:理论框架提供了“截止点应该随时间单调扩大、在终点达到全频率”这一正确的定性形状,但具体的函数形式在实际使用中需要根据分辨率和分块大小做经验性调整。线性方案是一个在多种配置下都足够稳健的默认选择。

七、在文字生成图片模型中的迁移表现

研究团队进一步把频谱强制插入了SenseNova-U1,一个“原生视觉-语言模型”(即不依赖独立图像编码器、直接处理原始图像像素块的统一文本-图像模型)。这类模型为了控制序列长度,通常也采用较粗的图像分块,正好落在频谱强制的有效区间内。

在DPG-Bench(一个评测文字生成图像综合能力的基准测试)上,加入频谱强制后整体分数从64.35提升到67.85,涵盖的13个子类别中有9个获得改善。提升最集中的子类别是“实体状态”、“实体整体”、“计数”等需要捕捉整体语义结构的维度,而不是那些依赖高频细节的类别——这与理论预测一致,因为这类语义信息主要编码在低频成分中。

在GenEval(另一个文字生成图像能力基准测试)上,总体分数从3.87%提升到4.56%(相对提升约18%),其中“单一物体”类别提升2.81个百分点(约19%),“颜色”类别提升1.33个百分点(约16%)。值得注意的是,这些测试是在模型训练早期(10万步)进行的,需要复杂理解能力的复合构图类别(如“两个物体同框”、“计数”等)在这个阶段两个模型都还是零分,尚未发展出相关能力。

八、各项配置和细节对效果的影响

研究团队还系统性地测试了若干设计参数的影响,为希望实际使用频谱强制的人提供了充分的参考。

关于最低截止点(控制滤镜在训练最初始时刻能通过多少频率),研究发现该参数对效果的影响是单调的:截止点越大(滤镜越宽松),效果越接近基线;截止点越小(滤镜越严格),早期训练越困难,但给AI创造的“迫使它专注低频”的压力也越大。默认值0.05在多种配置下表现稳健。

关于图像分辨率的影响,玩具实验中把图像尺寸从64×64扩大到512×512(同时保持图块数量固定为64),解析方案的相对优势随分辨率增大而显著增强:在64×64时基线最优,解析方案比基线差;在256×256时解析方案已经明显领先基线约15%;在512×512时仍保持约3.3%的优势。在真实ImageNet数据上,在512×512分辨率下,原本在256×256时与基线持平的配置,加入频谱强制后获得了3.4%的FID改善。这说明更高分辨率的训练场景是频谱强制更自然的主场。

关于训练与推理的计算开销,全文反复确认:频谱强制仅需一次前向和一次逆向2D-DCT变换,计算量约为基线的0.5%,无可学习参数,无额外内存占用。在推理阶段,同样在每个采样步骤的图像输入上应用同样的滤镜,开销同样可以忽略不计。

归根结底,这项研究的贡献是把一个长期隐藏在AI训练过程中的“结构性浪费”变得可见,并用最小代价将其修复。扩散模型在训练时确实存在一个“有效工作区间”——在这个区间之外,模型要么在机械地解固定方程,要么在做比随机猜测还差的事情。频谱强制把这条边界显式化,用一个动态变化的滤镜告诉模型“现在只有这些频率是值得学习的”,从而让模型把有限的计算力集中在真正重要的地方。

对于普通用户而言,这意味着未来使用类似技术训练的图像生成模型,在同等算力预算下可以更快收敛、生成质量更高;对于开发者而言,这是一个几乎无代价即可接入现有训练流程的改进,尤其对那些出于成本考虑不得不使用粗分块方式的原生视觉-语言模型更有意义。

当然,频谱强制不是所有场景的万能解。如果你的数据本身就富含高频关键信息(比如医学图像中的细微病变),或者你的模型已经在用非常细的分块方式处理图像,频谱强制的贡献就会大幅缩水。研究团队在这方面保持了相当清醒的自我评估,没有把一个有条件适用的技术包装成无限通用的突破——这种清醒本身就值得学习。

Q&A

Q1:频谱强制需要修改扩散模型的训练流程吗?

A:频谱强制不需要修改训练的任何核心部分。它只是在图像送入模型之前,加了一个基于当前训练时刻动态调整截止频率的低通滤镜,损失函数、采样器、模型架构、EMA权重全部保持原样。计算量约增加0.5%,没有任何新的可学习参数。

Q2:频谱强制在所有图像生成任务中都有效吗?

A:不是所有场景都有效。频谱强制在两个条件同时满足时效果最好:图像被切成较少、较大的图块(比如64块),以及图像的高频内容主要是噪点而非关键信号。当图像本身富含高频边缘信息(比如轮廓鲜明的几何图形),或者模型本身就采用细粒度分块(比如256块),效果会明显减弱,甚至可能略微下降。

Q3:频谱强制的线性调度方案为什么比理论推导的解析方案在ImageNet标准设置下更好?

A:理论上解析方案应该最优,但在256×256分辨率、64个图块的标准ImageNet配置下,解析方案对高频内容的屏蔽过于激进,且早期截止点增长太慢,导致模型长时间接收不到足够丰富的训练信号。线性方案增长更均匀,避免了这个问题。在更高分辨率(512×512以上)的场景中,解析方案的优势会重新显现。

本文内容来源于网友投稿,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

Mac软件 更多
photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。