展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 业界资讯 > 最新RLHF拯救语言模型「胡说八道」!微调效果比ChatGPT更好,两名华人共同一作

最新RLHF拯救语言模型「胡说八道」!微调效果比ChatGPT更好,两名华人共同一作

RLHF(基于人类反馈的强化学习)的一大缺点,终于被解决了!没错,虽然RLHF是大语言模型“核心技巧”之一,然而这种方法也存在一个问题——它只会判断生成文本的整体效果,不会仔细判断细节是否存在事实性错误、信息不完整和相关度等问题。换而言之,传统的RLHF只会对大语言模型的整个输出进行打分,而不会揪出细节上的毛病。为此,华盛顿大学和艾伦人工智能研究院的研究人员提出了一种新的RLHF框架——FINE-GRAINEDRLHF(细粒度的人类反馈强化学习)。这个RLHF框架包含多种不同类型的“打分器”(reward

RLHF(基于人类反馈的强化学习)的一大缺点,终于被解决了!

没错,虽然RLHF是大语言模型“核心技巧”之一,然而这种方法也存在一个问题——

它只会判断生成文本的整体效果,不会仔细判断细节是否存在事实性错误、信息不完整和相关度等问题。

换而言之,传统的RLHF只会对大语言模型的整个输出进行打分,而不会揪出细节上的毛病。

为此,华盛顿大学和艾伦人工智能研究院的研究人员提出了一种新的RLHF框架——FINE-GRAINED RLHF(细粒度的人类反馈强化学习)。

最新RLHF拯救语言模型「胡说八道」!微调效果比ChatGPT更好,两名华人共同一作

这个RLHF框架包含多种不同类型的“打分器”(reward model),通过对语言模型输出的每句话进行评估,从而提升生成文本的质量。

不仅如此,对这些“打分器”的权重进行调配,还能更灵活地控制语言模型输出效果。

事实证明,这种RLHF方法能很好地降低语言模型生成内容的错误率、毒性,并提升它回答问题的全面性和解析能力。

所以,这个RLHF方法究竟长啥样?

对传统RLHF进行两大改进

这个名叫FINE-GRAINED RLHF的框架,核心目的就是细化传统RLHF的评估方法。

具体来说,在语言模型输出结果后,它要能标识出具体哪些句子是错误的、哪些部分是不相关的,从而更精细地指导模型学习,让模型更好地理解任务要求、生成高质量输出。

为此,它主要做了两大改进:

最新RLHF拯救语言模型「胡说八道」!微调效果比ChatGPT更好,两名华人共同一作

一方面,对要评估的文本进行拆解。

如果说之前的RLHF评估语言模型,就像老师给学生的高考作文整体打分,那么FINE-GRAINED RLHF,就像是先把学生的作文拆成一句句话,再给每句话进行打分。

另一方面,训练三个“打分器”,分别用来评估事实准确性、相关性和信息完整性:

  • 相关性、重复性和连贯性:给每一句话中的短句子(sub-sentences)进行打分。如果一句话里面的各个句子不相关、重复或不连贯就扣分,否则加分。
  • 错误或无法验证的事实:给每一句话(sentences)进行打分。如果一句话中存在任何事实错误,就扣分;否则加分。
  • 信息完整性:检查回答是否完整,涵盖与问题相关的参考段落中的所有信息,对整个输出进行评分。

为了检验模型的效果,研究人员用两大任务,对这种新RLHF和传统RLHF方法进行了评估。

两大任务效果均有提升

任务一:生成文本毒性评估

为了研究这种新框架的效果,研究人员先进行了去毒任务的实验。

实验使用了Perspective API来测量毒性,它可以返回一个介于0(无毒)和1(有毒)之间的毒性值。

最新RLHF拯救语言模型「胡说八道」!微调效果比ChatGPT更好,两名华人共同一作

上图展示了两种不同的打分机制,其中(a)是传统的RLHF打分机制,也就是对模型所生成的内容打一个“总分”。

而(b)则是新的RLHF评估方法,将输出的内容进行拆解,分成了两个句子,对两个句子分别打分。

针对模型生成的这两句话:

I am such an idiot.She is so smart!
(我真是个白痴。她真聪明!)

显然前半句话是造成生成内容有毒的关键。

传统(a)的方法,并没有指出这一点;而(b)的方法可以很好地指出问题所在。
对两种方法进行比较:

最新RLHF拯救语言模型「胡说八道」!微调效果比ChatGPT更好,两名华人共同一作

可以看到,在上面所有方法中,基于FINE-GRAINED RLHF框架,在多样性(Diversity,大语言模型创造丰富度)水平和其它方法相近的情况下,仍能保持生成内容的毒性最低。

最新RLHF拯救语言模型「胡说八道」!微调效果比ChatGPT更好,两名华人共同一作

与此同时,根据上图的困惑度曲线,FINE-GRAINED RLHF的毒性下降速度更快,同时保持较低水平的困惑度(Perplexity,越低表示模型对给定序列的预测越准确)。这表明基于FINE-GRAINED RLHF框架学习比传统的RLHF更高效。

关于这一点,其中一个解释是:

新的RLHF方法能够确定有毒内容的位置,这与传统RLHF方法用的整体打分相比,提供的训练目标更明确。

综上,可以看到FINE-GRAINED RLHF在去毒任务中表现更为良好。

任务二:长篇问答

紧接着,研究人员还对FINE-GRAINED RLHF进行了长篇问答任务的实验。

他们收集了一个包含人类偏好和细粒度反馈的长问答数据集——QA-Feedback,基于ASQA(一个专注于回答模糊事实性问题的数据集)制作。

然后,对不同的微调方法(SFT监督微调、Preference RLHF)进行了评估:

最新RLHF拯救语言模型「胡说八道」!微调效果比ChatGPT更好,两名华人共同一作

△人工评估的不相关性错误(左图)和事实性错误(右图)

与其它方法相比,FINE-GRAINED RLHF生成的内容在事实上更正确,包含更完整的信息。

相比当前表现较好的微调方法,如SFT和Preference RLHF,FINE-GRAINED RLHF生成的无关、重复和不连贯错误也要更少。

最新RLHF拯救语言模型「胡说八道」!微调效果比ChatGPT更好,两名华人共同一作

△信息完整度评估,“win”表示FINE-GRAINED RLHF获胜,即在信息完整性方面表现更好;而“lose”表示FINE-GRAINED RLHF失败,即在信息完整性方面表现较差。

上面给出的是人工评估的结果,而在测试集上也有自动的评分。

在QA-FEEDBACK测试集上,评分结果与人工评估类似,四个系统在Rouge分数上都显示FINE-GRAINED RLHF效果更好:

最新RLHF拯救语言模型「胡说八道」!微调效果比ChatGPT更好,两名华人共同一作

△在QA-FEEDBACK测试集上的自动评估结果

更灵活地定制RLHF

此外,研究人员还发现,由于FINE-GRAINED RLHF中使用了多个“打分器”,调整它们的权重,就可能更为灵活地定制语言模型的行为。

例如,将更多的权重添加到评估信息完整性的“打分器”中,可能会使生成的信息完整性更好。

最新RLHF拯救语言模型「胡说八道」!微调效果比ChatGPT更好,两名华人共同一作

△不同奖励模型权重配置下FINE-GRAINED RLHF的测试集自动评估结果。

如上表所示,研究人员探索了FINE-GRAINED RLHF定制化语言模型行为的能力。

他们探索了三种“打分器”权重配置,并根据语言模型的平均文本生成长度,将它们分别命名为“short”、“medium”、“long”。

最新RLHF拯救语言模型「胡说八道」!微调效果比ChatGPT更好,两名华人共同一作

“short”生成了相关性更高的内容,但是事实性和完整性方面较差。与之相反,“long”提供了最准确和完整的生成内容。这反映出语言模型引用了大量的文本段落内容。而“medium”配置平衡了三种打分方法,并具有最高的得分。

不过,三个“打分器”之间还存在着竞争关系。

“相关性打分器”(the rel. reward model)偏向于生成短而简洁的回答,而”信息完整性打分器”(the comp. reward model)更偏向于生成更长、更丰富的回答。

因此,在训练过程中,这两个“打分器”会相互竞争,并最终达到一个平衡。

与此同时,“事实性打分器”(the fact. reward model)则会不断提高回答的正确性。

不过,移除任何一个“打分器”都会降低模型性能。

最后,研究人员还将他们的模型与ChatGPT的回答进行了比较。

ChatGPT在测试集上的RougeLSum得分为40.92,远低于本文使用FINE-GRAINED RLHF所训练的模型。

简单来说,ChatGPT生成的回答通常非常简洁且事实准确,但是缺乏澄清模糊问题所需的补充信息。

作者介绍

两位论文共同一作均是来自于华盛顿大学(University of Washington)自然语言处理研究小组的博士生。

Zeqiu Wu,本科就读于伊利诺伊大学电子与计算机工程系,并且取得了该校的硕士学位。

她的研究主要专注于信息检索型对话系统和通用交互系统。

曾在谷歌研究院的实习,担任学生研究员。

胡雨石(Yushi Hu),于2021年从芝加哥大学获得数学、计算机科学和经济学的学士学位。目前师从Mari Ostendorf教授和Noah A. Smith教授。

他的主要兴趣领域是多模态学习和基于人类反馈的强化学习(RLHF)。

此前,他还曾与美国阿贡国家实验室的Saidur Bakaul博士和清华大学的宁传刚教授合作过。

论文地址:https://finegrainedrlhf.github.io/

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系bd@zhengruan.com
作者最新文章
业界资讯 人工智能
相关文章 更多
精品专题 更多
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

Mac软件 更多
photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。