展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 港科大联手快手,让AI画图"减减肥":一个让图像生成更真实的小技巧

港科大联手快手,让AI画图"减减肥":一个让图像生成更真实的小技巧

研究团队发现强化学习训练使AI绘图模型速度场大小膨胀5%-15%,导致图像失真。据此提出NormGuard工具,在训练阶段精准压制该膨胀,保留奖励信号的同时显著提升图像真实感,经多种模型和训练方式验证有效。

研究团队发现了一个藏在AI绘图模型深处的有趣规律,并据此提出了一个叫做NormGuard的小工具,能在不影响AI绘图质量的前提下,悄悄纠正这种"过头"的毛病。这个工具的原理非常优雅,却被证明在多种不同的AI模型和训练方式上都稳定有效。

一、AI画图是怎么被"训练坏"的

要理解这项研究,先得弄清楚AI绘图模型是怎么工作的,以及它是怎么被强化学习训练"带歪"的。

现代的AI绘图模型,比如研究中用到的SD3.5-Medium和FLUX.2,采用了一种叫做"流匹配"(Flow Matching)的技术。可以这样理解:AI生成一张图片,就像从一团随机的噪点雪花开始,一步一步把它"雕刻"成一张清晰的照片。在这个雕刻过程中,每一步都有一个"方向和速度",告诉模型该往哪里走、走多快,这个"方向和速度"合在一起,就叫做"速度场"(velocity)。

为了让AI生成的图片更符合人类审美,研究人员会用强化学习对模型进行二次训练,类似于给这位雕塑家一个评分系统——评分高的作品会被鼓励,评分低的会被纠正。这个评分系统可以是PickScore(一个评判图片是否好看的AI评委)或者HPSv2(另一个人类偏好评分系统)。

问题就出在这里。强化学习确实能让AI图片的"评分"更高,但图片的肉眼观感却常常变差了——颜色失真、光线不自然、细节丢失。这就像一个学生为了应付考试而死记答案,成绩提高了,但真正的理解力却没有增长。

二、一个被研究团队发现的隐藏信号

研究团队在分析这个问题时,换了一个独特的观察角度。他们没有笼统地说"模型被训练坏了",而是去问:强化学习训练到底在模型内部改变了什么?

他们发现了一个非常具体的信号:经过强化学习训练之后,模型在每一步雕刻过程中的"速度"(velocity norm,也就是速度场的大小)都会比原始模型偏高,偏高幅度在5%到15%之间,而且这个现象在整个雕刻过程的每一步都存在,相当均匀。在三种不同的强化学习训练方法(NFT、AWM、DPO)下,这个现象都稳定出现。

用一个更直观的比喻来说,原始模型像一个稳健的雕刻师,每一凿的力道都恰到好处;而经过强化学习训练之后,这位雕刻师每一凿都用力过猛了一点,凿出来的图案棱角过硬、线条过深,失去了原本的细腻感。

这种"速度偏大"的现象有一个正式的名字,叫做"速度范数膨胀"(velocity norm inflation)。研究团队注意到,在AI绘图领域,有一种叫做"分类器自由引导"(Classifier-Free Guidance,简称CFG)的技术,之前也被发现会产生类似的速度膨胀问题,并且已经有人提出了一个简单的推理时修正方法:在生成图片的过程中,把速度的大小强行缩回到正常水平,同时保持方向不变。

三、为什么"推理时修正"在这里行不通

研究团队自然想到:既然CFG的速度膨胀可以通过推理时缩放来修正,那强化学习导致的速度膨胀,是否也可以用同样的方法解决?

他们进行了实验,结果出乎意料——这个方法在强化学习的场景下完全没用。把速度缩回到参考水平后,图片的评分没有提升,图片质量反而出现了更多的锐化瑕疵和不自然的光线。

这个区别其实不难理解。CFG的速度膨胀是一个外加的、实时的操作,有点像在菜里临时多加了一勺盐——你直接把那勺盐拿掉就行了。但强化学习的速度膨胀是在漫长的训练过程中被"烘焙"进模型权重里的,整个模型的各个部分都已经适应了这种"偏大的速度",这时候你再强行把速度缩小,就像把一道已经做好的菜重新加水稀释——菜的结构已经变了,你加水只会让它变得更难吃。

这个发现非常关键,它清楚地说明:对于强化学习导致的速度膨胀,必须在训练阶段就介入,而不能等到生成图片的时候再补救。

四、速度膨胀和"奖励"之间,其实关系不大

研究团队还追问了另一个关键问题:如果在训练时压制速度膨胀,会不会同时削弱模型从强化学习中获得的"有用奖励信号"?换句话说,速度偏大这件事,是不是正好承载了让图片评分更高的信息?

为了回答这个问题,他们用了一种叫做"伴随灵敏度分析"(adjoint sensitivity analysis)的数学工具。这个工具能计算出:如果把速度统一放大一点,图片的奖励评分会如何变化?

他们在超过6400个样本上进行了测算,结果表明:速度的统一缩放对奖励的影响非常杂乱。对于某些图片,速度放大会让奖励略微上升;对于另一些图片,则会让奖励略微下降;把所有图片的结果平均起来,信号几乎为零,噪音与信号的比值高达3倍到100倍。

这意味着速度的大小(也就是速度范数)并不是奖励信息的主要载体。奖励信息主要存在于速度的"方向"之中,而不是"大小"之中。就像一支乐队演奏,音乐的节奏和旋律(方向)才是打动听众的关键,而演奏的整体音量(大小)调高一点或调低一点,对效果的影响可以忽略不计。

正因如此,在训练时专门压制速度的"大小",几乎不会干扰模型习得的有用奖励信号。这就从理论上确认了:强制控制速度范数,既必要,又安全。

五、NormGuard:一把只管"用力过猛"的刹车

基于以上两个发现——推理时修正失效,速度范数不携带奖励信号——研究团队设计了NormGuard。

NormGuard的原理非常简洁。在训练的每一步,它都会比较当前模型的速度大小和原始参考模型的速度大小。如果当前模型的速度比参考模型大,就对超出的部分施加一个惩罚;如果当前模型的速度没有超出参考模型,则完全不做任何干预。

这种设计有个专业名字,叫做"铰链惩罚"(hinge penalty),直观来说就像一扇单向阀门:速度想变小,随便;速度想超过参考水平,受到阻力。具体的数学表达是:惩罚项等于λ乘以当前速度平方与参考速度平方之差,再除以参考速度平方,下限为零。其中λ是一个控制惩罚力度的参数,整个工具只多出这一个需要调节的数字。

NormGuard被直接叠加在原有的强化学习训练损失函数之上,不需要替换任何已有的训练步骤。研究团队在论文中仔细分析了三种常用的强化学习训练方法——NFT、AWM和DPO——并证明这三种方法的梯度更新都具有一种共同的数学结构,叫做"速度局部损失",而NormGuard恰好作用于同一个空间,因此可以和这三种方法无缝组合。相比之下,另一种叫做Flow-GRPO的方法在数学结构上与这三种不同,梯度通过轨迹级别的概率比传播,不直接适用NormGuard的框架,研究团队明确将其排除在适用范围之外。

六、实验结果:真的管用,而且不止一点点

为了验证NormGuard的效果,研究团队做了大量实验,覆盖了两种基础模型(SD3.5-Medium和FLUX.2-klein-base-4B)、三种强化学习训练方法(NFT、AWM、DPO)和两种奖励评分系统(PickScore和HPSv2),总共七种不同的配置组合。

在图像质量方面,研究团队请了两位多模态大语言模型"评委"——Qwen3.5-35B和GPT-4.1——对使用NormGuard和不使用NormGuard生成的图片进行两两比较,评判标准涵盖物理真实性、纹理细节、边界自然度、色彩一致性、语义合理性和瑕疵检测六个维度。结果显示,在全部七种配置中,两位评委都一致认为NormGuard的输出质量更好,胜率大多在47%到73%之间,而基准方法的胜率则在20%到46%之间。两位评委的判断方向完全一致,这表明质量提升是真实的,而非某个评委的偏好导致的。

在图像真实感方面,研究团队使用了一个叫做Forensic-Chat的AIGC检测工具,这个工具能判断一张图片更像真实照片还是AI合成品,给出一个"真实感分数"(RealScore)。在七种配置中,NormGuard在六种配置下提升了真实感分数,只有在AWM方法下出现了轻微的真实感分数下降,但同时MLLM评委的质量评分有了更大的提升,说明这两个维度并不完全一致。

在奖励保留方面,使用NormGuard之后,PickScore的变化范围在-0.003到+0.011之间,HPSv2的变化范围在-0.004到+0.001之间。换句话说,强化学习辛苦得来的评分几乎完全保留,没有被显著削弱。

如果把各种配置在图表上标出来,会看到一个有趣的规律:加了NormGuard之后,每个点几乎是垂直向上移动的——奖励评分基本不变,但图像质量大幅提升。这正好印证了研究团队的判断:速度范数膨胀携带的奖励信息很少,压制它不会损失多少奖励,却能大幅改善图像质量。

七、更少的推理步骤,更明显的效果

研究团队还做了一个特别值得关注的实验:把生成图片所用的步骤数从默认的28步减少到10步,再减少到4步,看看NormGuard的效果如何变化。

结果表明,步骤越少,NormGuard的优势越明显。在28步时,MLLM评委的胜率差距是9个百分点;到4步时,差距扩大到20个百分点。而基准方法在步骤减少时,真实感分数从0.239急剧下降到0.189,而NormGuard版本的真实感分数则相对稳定,从0.274下降到0.221。

这个现象背后有清晰的物理逻辑:步骤越少,每一步的"跨度"就越大,速度偏大的影响也就越被放大。就像同样是用力过猛的一锤,如果总共只有四锤,每一锤都用力过猛的后果会比有二十八锤时严重得多。这也意味着NormGuard对于快速生成场景(比如实时应用)尤为有价值。

八、不是"早停"的功劳,也不是"KL正则"的副本

研究团队还排除了两种可能的质疑。

第一种质疑是:NormGuard是否只是让训练慢了一点,本质上和"早停"(提前结束训练)是一回事?研究团队对比了基准方法在第160步、180步、200步的检查点,与NormGuard在第200步的结果。结论是:NormGuard在第200步的奖励评分、真实感分数和MLLM质量分数,全都高于基准方法在任何一个早期检查点。因此,NormGuard的效果无法用提前停止训练来复现。

第二种质疑是:已经有一种叫做"KL正则"的常规方法,通过限制模型与原始模型的整体差距来防止过度优化,NormGuard是否只是KL正则的重复?研究团队的实验表明,在有KL正则的情况下加入NormGuard,真实感分数仍然进一步提升;在没有KL正则的情况下,NormGuard同样有效。两种方法针对的是不同的失效模式:KL正则限制的是速度的整体偏移(包括方向和大小),而NormGuard只针对速度的大小超标部分,不干涉方向的变化。两者可以叠加使用,互相补充。

说到底,这项研究做的事情非常清晰:它找到了AI绘图在强化学习训练过程中一个具体的、可测量的"用力过猛"信号,证明这个信号是多余的、有害的,然后设计了一个只针对这个信号的精准干预工具。从发现问题、诊断原因、证明安全性、设计方案,到多维度验证效果,整条研究链条环环相扣。

归根结底,这项工作告诉我们,AI模型在被"奖励驱动"的过程中,很可能悄悄做了一些并不有益的额外动作,而这些额外动作往往可以被精准地识别和修正,而不必粗暴地限制模型的整体学习。这个思路——把模型的变化分解成"有用的部分"和"多余的部分",然后只压制多余的部分——对未来的AI训练研究有着相当广泛的启发意义。

对实际应用而言,这意味着在不降低AI绘图"好看程度"的前提下,生成的图片可以更自然、更真实、在步骤减少时更稳健。

Q&A

Q1:NormGuard是什么,能解决什么问题?

A:NormGuard是一个在AI绘图模型强化学习训练阶段使用的正则化工具。它发现强化学习训练会让模型的"速度场大小"(velocity norm)普遍偏高5%到15%,这种偏高会导致图片出现过度锐化、颜色失真、光线不自然等问题。NormGuard通过一个单向惩罚机制,只要速度大小超过原始模型水平就施加约束,从而在保留奖励评分的同时改善图像真实感。

Q2:为什么不能在生成图片的时候才修正速度膨胀问题,而一定要在训练时处理?

A:实验发现,在推理阶段强行把速度大小缩回参考水平,图片的奖励评分没有提升,图像质量反而更差,出现了更多锐化和光线失真问题。这是因为强化学习训练把速度膨胀"烘焙"进了模型权重,整个模型已经适应了偏大的速度,推理时强制缩减会破坏这种适应,只有在训练阶段介入才能从根本上解决问题。

Q3:NormGuard会不会影响AI绘图模型通过强化学习获得的图像质量提升?

A:实验数据表明影响极小。在PickScore上,加入NormGuard前后的评分变化范围在-0.003到+0.011之间;在HPSv2上,变化范围在-0.004到+0.001之间。理论分析也证明,速度大小并不是奖励信息的主要载体,奖励主要由速度的方向变化承载,因此限制速度大小不会系统性地削弱奖励信号。

本文内容来源于网友投稿,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

Mac软件 更多
Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

WINDOWS 更多
Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。