展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 新加坡国立大学等机构联合攻克AI知识蒸馏核心难题

新加坡国立大学等机构联合攻克AI知识蒸馏核心难题

新加坡国立大学等机构提出双重在线策略蒸馏(DOPD),解决AI知识蒸馏中“特权幻觉”问题。DOPD通过区分能力差距与信息差距,为每个词动态分配教学方式,使小模型在数学推理和代码任务上超越老师,填补性能差距的89.8%。

这项由新加坡国立大学、香港中文大学多媒体实验室、北京大学以及京东探索研究院联合开展的研究,于2026年6月29日以预印本形式发布,论文编号为arXiv:2606.30626。

想象一下这样一个场景:巨大的超级计算机里,运行着规模庞大、能力超群的AI模型。但现实世界远没有那么奢侈——手机、平板、边缘设备,这些才是AI真正需要扎根的地方。于是,一项关键技术应运而生:让“大模型老师”把自己的本领传授给“小模型学生”。这个过程,研究者称之为知识蒸馏。说白了,就像把一瓶浓缩果汁稀释到小瓶子里,让学生喝下去也能品出老师的味道。

然而,这项看上去很美的方法,却长期藏着一个让人头疼的困境。当研究者们试图给老师装备“小抄”——也就是额外的辅助信息——来提升教学效果时,反而发现学生的学习效果远没有预期那么好,有时候甚至还会更差。这究竟是为什么?新加坡国立大学等机构的研究团队经过一番深入调查,终于揪出了问题的根源,并拿出一套全新的解决方案,命名为DOPD(双重在线策略蒸馏)。

一、为什么给老师配“小抄”反而会害了学生

要理解这其中的门道,得先看看当下最主流的AI教学方式是怎么运作的。研究者们把这种方式叫做“在线策略蒸馏”。核心思路其实很简单:不让学生去背书上的标准答案——那样学生总在学别人的思路,一旦自己遇到难题就乱了阵脚——而是让学生自己先尝试解题,然后由老师针对学生写下的每一个字给出实时点评。因为这种反馈直接针对学生的思路,效果比传统方式好得多。

一个很自然的想法是:如果给老师也配上“小抄”,比如在数学题旁边附上解题思路提示,让老师能做得更好,那么老师给出的反馈岂不更有价值?研究团队发现,这个想法在理论上成立,但在实践中却藏着暗坑。

他们把这个暗坑命名为“特权幻觉”。咱们来打个比方:假设你和你的同学都在参加一场闭卷考试,你的成绩是70分,同学是50分,差距是20分。这20分的差距可能来自两种原因——一是你比同学更聪明、更努力;二是有人偷偷告诉了你几道题的答案,而你同学啥也没得到。如果第二种原因占了主要部分,那么这20分的差距就不是“能力差距”,而是“信息不对称”造成的。

同样的逻辑放到AI知识蒸馏中:当老师模型拿着小抄(额外的提示信息)比学生表现好得多时,这个优势究竟有多少是来自真正的能力领先,又有多少是因为老师多看了一份学生根本没摸过的材料?如果硬要学生去模仿一个靠着小抄才答对题的老师,学生就会试图“背答案”而不是“学方法”——结果就是学生表面上学会了如何在有小抄的环境下作答,一旦小抄消失,什么都不记得了。

研究团队通过实验直观地展示了这一点。他们测试了四种情况:正常老师教正常学生、带小抄的老师教正常学生、正常老师教带小抄的学生,以及两者都带小抄。结果发现,只给其中一方配备小抄,早期训练成绩虽然略有提升,但随着训练推进,模型的“熵”——可以理解为思维活跃度和探索欲——会急剧崩塌,最终成绩反而比什么都不加还要难看。而两者都带小抄时,虽然消除了信息不对称,但如果对所有内容都用同样的力度来教,学生也只是被动适应小抄,最终成绩提升依然极为有限,甚至不如最基础的方法。

这个发现既有趣又有些让人沮丧——原来盲目给老师发小抄不仅没好处,还可能给整个教学过程埋下隐患。

二、真正的差距和“小抄差距”究竟该如何区分

既然问题出在没法区分“能力差距”和“信息差距”,那有没有办法把二者分开呢?研究团队提出了一个很巧妙的衡量标准,他们叫它“特权优势差距”。

操作方式是这样的:同时给老师和学生配上相同的小抄,然后让他们各自预测同一个词的概率。这时候,两者的信息条件完全相同,不存在任何信息不对称。在这种公平竞争的环境下,如果老师的预测概率还是远远高于学生,那说明这道题涉及的内容是真真正正的“能力差距”——老师就是比学生强,这类知识值得下大力气学。反过来,如果两者概率差不多,说明在公平条件下双方旗鼓相当,之前老师显得更厉害主要是因为信息优势,而不是能力本身。

研究团队用一个类比来验证这个判断是否靠谱:他们人为地删除AI在生成文字时那些“特权优势差距”最大的20%的词,然后观察学习效果是否大幅下降。结果非常明显——去掉这20%的高差距词之后,模型在100步训练时只能达到正常情况下大约50%的学习效果。而删除那些差距最小的20%词,或者随机删除20%的词,对学习效果几乎没有影响。

这个实验说明,高差距词确实是知识传递中最关键的“养分”,而低差距词更多是些无关紧要的填充。更有意思的是,即便删掉了那20%的高差距词,模型还是能比完全不学习提升3到4分——这说明其他词虽然算不上主角,也并非毫无价值。

正是基于这套“用公平条件下的差距来判断真实能力差距”的思路,研究团队设计出了DOPD的核心机制。

三、四种角色扮演:聪明地决定每个词该由谁来教

DOPD的核心创意在于:不是让老师或学生一统天下地负责所有词的教学,而是根据每个词的具体情况,动态分配最适合的教学方式。研究团队按照“特权优势差距”的高低,以及老师和学生各自的预测概率高低,把所有词分成四种类型,分别采取四种不同的对策。

第一种情况:差距不大,且老师和学生的预测概率都比较高。这意味着面对这个词,两个配了小抄的模型都很有把握,而且两者之间没有明显的差距。这类词就像一道大家都会的简单题——正确答案几乎人尽皆知,真正的门槛不是能力,而是知不知道题目提示。对于这类词,研究团队选择“轻量级老师蒸馏”,让学生稍微借鉴一下老师的概率分布,吸收有用的小抄知识,但不要过分追着老师学,以免染上“依赖小抄”的坏习惯。

第二种情况:差距不大,但老师和学生的预测概率都比较低。两个模型面对这个词都不太确定,说明这里可能是个难点或者边界地带,双方都在“猜”。如果这时候强迫学生去模仿老师那半猜半蒙的答案,反而可能引入噪声。研究团队的策略是“微弱的自我正则化”——让学生轻轻地向自己带小抄的版本靠拢一点,不是为了学知识,更多是为了维持稳定性,避免训练过程产生剧烈波动。而且这种靠拢会故意切断梯度,让“有小抄的自己”只是一个参考锚点,而不是主动的知识来源,防止学生陷入“依赖幻觉信号”的循环。

第三种情况:差距很大,且老师的预测概率远高于学生。这是最宝贵的学习机会——老师在公平条件下(双方都有小抄)仍然比学生强得多,说明这个词涉及的是真正的能力差距,老师有学生亟需学习的真本领。对于这类词,研究团队采用最强的“深度全词汇老师蒸馏”,不仅让学生学习老师最看好的那几个候选词,而是对整个词汇表的概率分布都进行对齐学习,信息密度最高,收益也最大。所用的数学工具是JS散度,它既不像“正向KL散度”那样要求学生把老师每一个角落都覆盖到(容易过于分散),也不像“反向KL散度”那样只盯着老师最确定的答案(容易过于极端),而是找到一个平衡,既覆盖老师的主流选择,又保留一些次优选项的信息。

第四种情况:差距很大,但这次是学生的预测概率高于老师。这有点意思——学生带着小抄比老师还有把握?这往往意味着这个词是学生目前探索出的一条“自信路径”,而老师在这里反倒不那么确定。强行让学生去模仿一个比自己还不确定的老师,显然是本末倒置。研究团队的策略是“轻量级学生自蒸馏”——让学生轻轻向自己有小抄的版本靠拢,保持探索的动力,不过分压制这种自主发现的路径。

把这四种策略综合起来,DOPD就像一位经验丰富的班主任:它既知道哪些知识点非要老师亲自出马不可,哪些地方学生自己探索更有收获,哪些地方老师也说不清楚不必强迫学生跟着学,也知道什么时候给学生轻轻一个“别偏题”的提示就够了。每个词都得到了最合适的待遇,没有一刀切的暴力灌输,也没有放任自流。

四、实验中的惊喜:小模型竟然在某些题目上超越了大模型

研究团队在多个大型基准测试上验证了DOPD的效果,覆盖了纯文字的大语言模型场景和图文结合的视觉语言模型场景。

在纯文字场景下,实验以Qwen3-8B(80亿参数的大模型)为老师,Qwen3-1.7B(17亿参数的小模型)为学生。两者之间原本存在13.7分的平均性能差距,跨通用能力、推理能力和代码编写能力等八个测试集。经过DOPD训练后,学生模型达到了51.4分的平均成绩,不仅比最基础方法(Vanilla OPD,43.9分)提升了7.5分,更填补了原本差距的89.8%——也就是说,经过训练,小模型几乎追平了大模型的水平。更令人意外的是,在数学推理(AIME25)和代码(LCBv5)等挑战性较高的任务上,小模型甚至超过了老师的分数,突破了原本的理论上限。

这一点尤其值得关注。传统的蒸馏方法有一个公认的天花板:学生无论如何都不可能超过老师,因为老师的输出就是学生的目标。DOPD通过引入小抄机制,让老师的“潜力”得到了更充分的释放,从而帮助学生获得了老师在普通条件下都无法达到的水准。

在视觉语言模型场景下,同样以大模型Qwen3-VL-8B为老师,Qwen3-VL-2B为学生。原本差距14.6分,经过DOPD训练后,学生提升了10.1分,填补了差距的69.2%,同样大幅领先于所有竞争方法。

除了直接的分数比较,研究团队还测试了另外四个维度。其一是规模扩展性——他们用不同大小的老师和学生进行了五对组合实验。结论是,当老师比学生大得越多(比如参数量相差13倍的8B到0.6B),普通蒸馏方法的效果反而越来越差,增益只有3.5分;而DOPD不受这个限制的拖累,反而在这种大差距场景下保持稳健,增益高达14.1分,差距弥合率达到53%。

其二是持续学习能力。研究团队设计了一个三阶段实验,先用通用数据训练,再切换到推理数据,最后切换到代码数据,观察模型是否会“以新忘旧”。结果表明,DOPD能够让模型每换一个新领域都有实质提升,同时对之前学过的内容只有极微小的遗忘,表现出真正意义上的持续学习能力,而不是简单地用新知识覆盖旧知识。

其三是跨领域泛化。研究团队只用推理数据训练模型,然后测试它在代码任务上的表现,反之亦然。DOPD在这两个方向上都比最强竞争方法高出3到4分,说明它学到的是更本质的能力,而不是对某类任务的过拟合。

其四是训练稳定性。研究团队绘制了整个训练过程中的性能曲线和熵变化曲线。DOPD从训练第80步开始就已经超越了其他方法在第200步的最终成绩,收敛更快,表现更平稳。熵的变化也很健康:先小幅上升(模型在探索),再逐步下降(模型在收敛),最终稳定。相比之下,依赖自我蒸馏的方法会在第95步前后出现熵的突然崩塌,对应着模型陷入一种过于单调、丧失探索能力的状态。

五、每种小抄的内容都很关键——给得好才是真的好

在整个研究体系中,有一个容易被忽视但极为重要的细节:小抄的形式直接决定了效果的好坏。

研究团队对五种不同的小抄形式进行了比较。最直接的一种是直接给出正确答案,结果反而是最差的——59.5分,甚至低于完全不提供任何小抄的63分基线。原因是模型直接盯着答案去学,完全跳过了中间的思考过程,只学到了“背答案”这一个坏习惯。加入了详细执行步骤的分步提示勉强提升到63.1分,但依然有限,因为过于详细的步骤又让模型过度依赖信息本身。效果最好的是“只给步骤框架、不给执行细节和最终答案”的分步提示,达到了71.3分,比基线高了8分多。用一句话概括最简短的摘要式提示效果也不错(65.8分),但略逊于步骤框架式。

在视觉语言模型场景下,类似的规律同样成立。直接给答案最差,仅提供图像描述文字效果有限,而给出与问题相关的目标物体位置框(包含物体名称和坐标)效果最好,比基线高出4到7分。

这个发现传递了一个核心信息:小抄的价值不在于告诉模型“答案是什么”,而在于帮助模型理解“该怎么思考”。一旦小抄越过了这条线,开始直接提供答案,它就不再是学习的引导,而变成了作弊的工具。

说到底,DOPD解决的不是一个单纯的工程优化问题,而是揭示了AI知识传授中一个更本质的困境:盲目地给AI模型配备更多信息,并不等于给了它更多的学习机会。信息本身是双刃剑——用对了是催化剂,用错了是绊脚石。通过设计一套能精准识别“有效能力信号”和“信息幻觉”的路由机制,研究团队让AI学生第一次能够在接受老师指导的同时,真正区分哪些内容值得用心学,哪些内容只是老师借助外力才能给出的参考,不必生搬硬套。

对于普通人而言,这项研究最直接的影响是:未来手机、平板、汽车车机中运行的小型AI助手,可能会比现在更聪明、更靠谱,甚至在某些推理和编程任务上达到目前只有最顶级AI才能完成的水平——而这一切无需消耗更多算力,只需要一套更聪明的教学方式。归根结底,好的老师不只是知识量更大,而是知道什么时候该倾囊相授、什么时候该让学生自己想一想。这个道理对人如此,对AI同样适用。

本文内容来源于网友投稿,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

Mac软件 更多
photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。