展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 业界资讯 > 大模型Meta通过自我奖励和迭代战胜GPT-4,证明了LLM终局是由合成数据构成的

大模型Meta通过自我奖励和迭代战胜GPT-4,证明了LLM终局是由合成数据构成的

Llama2-70B一夜之间打败GPT-4,让整个AI社区为之震惊!甚至,在AlpacaEval2.0排行榜中,微调后的模型胜率完全碾压Claude2、GeminiPro等模型。Meta和NYU研究团队究竟提出了什么秘制配方,才能让Llama2-70B超强进化?题目所述的「自我奖励语言模型」是一个训练数据生成和评估的模型,它使用生成的数据自行进行训练。简单来说,最新方法可以让LLM在迭代训练过程中不断自我改进。论文地址:https://arxiv.org/pdf/2401.10020.pdfLeCun也转

Llama 2-70B一夜之间打败GPT-4,让整个AI社区为之震惊!

甚至,在AlpacaEval 2.0排行榜中,微调后的模型胜率完全碾压Claude 2、Gemini Pro等模型。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

Meta和NYU研究团队究竟提出了什么秘制配方,才能让Llama 2-70B超强进化?

题目所述的「自我奖励语言模型」是一个训练数据生成和评估的模型,它使用生成的数据自行进行训练。

简单来说,最新方法可以让LLM在迭代训练过程中不断自我改进。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

论文地址:https://arxiv.org/pdf/2401.10020.pdf

LeCun也转赞了自家实验室的研究。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

RLAIF已经不是新鲜事了,之前包括Anthropic,谷歌都推出过自己的「AI训AI」的技术,那么Meta的这项工作和之前的几家的RLAIF区别在哪里呢?

我们先来了解一下Meta的自我奖励语言模型的大概框架。

研究团队开发了一个能够遵循指令和自我评价回复质量的能力的模型。模型可以生成新的训练数据,对生成的回复进行质量评分,从而不断改进自己的输出。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

模型首先根据少量人工标注数据进行预训练,获得初始化模型。

然后模型生成新的指令和多个候选回复,并使用LLM-as-a-Judge的提示,让模型对自己生成的回复打分。

根据打分形成新的训练数据,继续训练模型。

这样可以迭代训练,在每次迭代中模型的遵循指令能力和打分能力都会提升。

研究人员从Llama 2 70B预训练模型开始迭代训练。

结果显示在3次迭代中,模型遵循指令的能力有显著提升,同时奖励建模能力也在提高,评价结果与人工判断的相关性更高。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

这说明模型迭代过程中,不仅指令遵循能力提高,也更善于对自己生成的回复进行判断。

迭代第三次的模型在AlpacaEval 2.0基准测试中,就战胜了Claude 2、Gemini Pro、GPT-4 0613等模型。

Meta的这项工作与谷歌在去年9月发布的RLAIF论文相比,更近一步地使用了一个不断进化的奖励模型来不断迭代训练模型,而迭代后的模型也确实取得了明显可见的性能提升。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

可以说,Meta又将AI自我迭代大模型的前沿往前推进了一大步。

如何训练「自我奖励语言模型」

研究人员的方法首先假设可以访问基本的预训练语言模型和少量人工注释的种子数据。

然后研究人员建立一个模型,让它同时拥有两种能力:

  1. 指令遵循:给出描述用户请求的提示,能够生成高质量、有帮助(且无害)的响应。
  2. 自指令创建:能够按照示例生成和评估新指令,再添加到自己的训练集中。

这两个能力可以为了使模型能够执行自我对齐,即它们是用于使用人工智能反馈(AIF)迭代训练自身的组件。

自指令创建包括生成候选响应,然后模型本身判断其质量——充当自己的奖励模型,取代外部奖励模型。

这是通过LLM-as-a-Judge机制实现的:通过将响应评估制定为遵循指令的任务。

这个由模型自行创建的AIF偏好数据被用作训练集来训练模型。

整体自我对齐过程是一个不断迭代过程,通过构建一系列此类模型来进行,目的是每个模型都比上一个模型有所改进。

重要的是,由于模型既可以提高其生成能力,又可以通过相同的生成机制作为自己的奖励模型,这意味着奖励模型本身可以通过迭代过程来改进,这就不同于奖励模型固定不变的传统方法。

研究人员相信这样可以提高这些学习模型未来自我改进的潜力上限,消除限制性瓶颈。

初始化

种子指令跟随数据

研究人员获得一组人工编写的(指令提示、响应)一般指令。

他们使用这些示例从预训练的基础语言模型开始,用监督微调 (SFT) 的方式进行训练。

种子LLM-as-a-Judge指令跟随数据

研究人员假设他们提供了一组种子(评估指令提示、评估结果响应)示例,这些示例也可用于训练。

虽然这并不是绝对必要的,因为使用IFT数据的模型已经能够训练LLM成为judge,而且研究人员表明此类训练数据可以提供改进的结果。

在这些数据中,输入提示要求模型评估对特定指令的给定响应的质量。

提供的评估结果响应包括思路推理,然后是最终分数(在研究人员的实验中,满分 5 分)。

研究人员为这些提示选择的格式如下图2所示。作为LLM执行奖励模型角色的训练数据。

这些数据被称为评估微调(EFT)数据。

研究人员在训练期间使用这两个种子数据集。

再用3个步骤来创建自我指令:

-使用研究人员已经训练好的模型,研究人员可以让它自我修改自己的训练集。具体来说,就是为下一次训练迭代生成额外的训练数据。

-生成候选响应:然后,对于给定的提示 x,研究人员生成 N 个不同的候选响应 {y, . 。。, y} 。

-评估候选响应:最后,研究人员使用同一模型的LLM-as-a-Judge能力来评估其自己的候选响应,得分为 r∈ [0, 5](见图 2)。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

指令遵循训练

训练最初是使用种子 IFT 和 EFT 数据进行的,这与奖励模型固定的标准实践不同。然后通过AI(自我)反馈添加附加数据。

AI反馈训练

执行自指令创建过程后,研究人员可以使用额外的训练示例来扩充种子数据,研究人员将其称为 AI 反馈训练 (AIFT) 数据。

他们尝试了此类反馈的两种变体:

偏好对:研究人员构建以下形式的训练数据(指令提示 x,获胜响应 y,失败响应 y)。为了形成获胜和失败对,研究人员从 N 个评估的候选答案中选取最高和最低得分的答案。

将这些对可用于通过偏好调整算法进行训练。

仅正面示例:在此变体中,研究人员遵循其他方法,将模型策划的(指令提示、响应)附加示例添加到种子集中,以进行监督微调。

整体自对齐算法

迭代训练

研究人员的整个过程训练一系列模型。其中每个连续模型t使用由t − 1模型创建的增强训练数据。

因此,研究人员将AIFT(M)定义为使用模型M创建的AI反馈训练数据。

M:基础预训练LLM,没有微调。

M1:用M初始化,然后使用SFT对IFT+EFT种子数据进行微调。

M2:用M1初始化,然后使用DPO用AIFT(M1)数据进行训练。

M3:用M2初始化,然后使用DPO用AIFT(M2)数据进行训练。

实验结果

如文章开始所提到的那张图中,研究人员将微调后Llama 2-70B三个迭代版本与其他先进模型在AlpacaEval 2.0基准上进行了比较。

结果显示,第三次迭代后的Llama 2-70B模型打败了GPT-4 0613、Claude 2、Gemini Pro等模型。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

此外,Llama 2-70B每个迭代版本比较,改进几乎保持线性。

研究人员通过各种指标来评估作为评估者的大模型,这些指标衡量与保留的人类偏好数据的一致性。

自我奖励迭代2(模型M2),使用从其先前迭代M1派生的自我奖励模型进行训练,其性能优于迭代1(M1)。

而M1本身也优于仅利用指令微调(IFT)数据训练的标准SFT基准模型。迭代3(模型 M3)比迭代2有了进一步提高。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

在这个框架之中,研究人员发现,奖励模型的性能也能随着迭代不断提高。

模型M2使用来自M1的奖励模型进行训练,与M1相比,在所有五个指标上都体现出了更好的性能。

例如,成对准确(pairwise accuracy)率从78.7%提高到 80.4%。M3继续进一步改进了其中几个指标。

研究人员猜测,是由于模型在指令遵循方面变得更好,因此它在LLM-as-a-Judge的任务方面也有所改进。

网友:让开源再次伟大

Meta和NYU的最新研究让许多人惊呼「让开源再次伟大」。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

俄亥俄州立大学计算机工程助理教授Yu Su表示,2024年才刚刚开始,我们已经从合成数据中看到了许多重要成果。我个人认为,这不仅仅是「数据增强」的改头换面。以前的数据增强工作在很大程度上依赖于「人类工程」,而现在更像是LLM的「想象力」...

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

越来越多的研究表明,「人工训练数据耗尽」不会阻止LLM的发展。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

这是DPO的「Attention Is All You Need」的时刻。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

还有人表示「令人惊讶的是,每次迭代的改进几乎保持线性,仅在3次迭代之后,就已经接近GPT-4级别」。

Llama 2打败GPT-4!Meta让大模型自我奖励自迭代,再证合成数据是LLM终局

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。