展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 7B小模型如何在代码任务上打败数百亿参数的大模型?

7B小模型如何在代码任务上打败数百亿参数的大模型?

研究团队提出并行循环Transformer,让70亿参数模型通过两次内部循环思考,在代码任务上超越数百亿参数的大模型,第三次循环后性能因收益-代价失衡而下降。结合显式推理链可进一步提升效果。

在AI领域,一直存在着一个充满诱惑的设想:如果我们暂时无法把模型做得“更大”,有没有可能让它变得更“聪明”?这就像在问:一个普通人,能否通过对同一个问题的反复思考,最终获得天才般的顿悟?

一个联合了北京航空航天大学、人民大学、IQuest Research、Langboat等机构的研究团队,在2026年6月通过预印本论文(arXiv:2606.18023)给出了一个既意外又在情理之中的答案:可以,但思考的“度”极其关键——多加一次循环,性能飙升;再多一次,反而会跌回原点。

一、为什么同样的参数,“想两遍”比“想一遍”厉害这么多

问题的核心在于“循环Transformer”这项技术。通常的语言模型是由层层堆叠的“神经回路”构成,信息像流水线一样单向传递。而循环Transformer走的是一条完全不同的路:它只有一组共享的神经回路,但这组回路会被反复调用多次。你可以把它想象成一个工匠:传统模型是流水线作业,每个工人只负责一道工序;循环Transformer则是同一个匠人,拿着同一套工具,对同一件作品反复打磨,每次打磨的角度和力度都在调整。

这个设计的魅力显而易见。理论上,你无需增加工具(参数量),仅靠“增加打磨次数”(循环深度)就能提升作品精度。这为“不靠堆料提升能力”开辟了一条新路径。早期研究已经证实,一个35亿参数的模型通过50次循环,甚至能达到相当于5000亿参数模型的“计算量”。

不过,工程上的障碍立刻浮现出来:循环次数越多,计算耗时成倍增加,还需要额外存储每次循环的中间状态,内存开销巨大。这就好比工匠每打磨一次都得拍张照片存档,打磨50次就得存50份档案,在实际部署中根本行不通。

于是,“并行循环Transformer”(PLT)应运而生,它用两个精巧的设计解决了工程难题:

1. 共享KV门控滑动窗口注意力: 第一圈处理时建立一个“全局知识库”,后续所有循环都可以直接翻阅这个固定库,无需各自新建,内存占用因此保持稳定。

2. 跨循环位置偏移(CLP): 这是实现并行的关键。它让各个循环不必严格按顺序等待。比如,第二圈不必等第一圈所有位置都处理完,而是可以基于第一圈邻近位置的信息提前开工。这就像把串行流水线改造成了错位并行的多道工序。

两者结合,使得PLT无论循环多少次,延迟和内存消耗都几乎与只循环一次相同。然而,天下没有免费的午餐——CLP机制带来了一个隐蔽的代价:为了实现并行,每个位置在第二圈及以后,接收的并不是自己上一圈的历史信息,而是旁边位置的信息。

这就好比修改自己的文章时,不看自己上一稿的思路,反而去参考旁边同学上一稿的思路。这种“位置错配”成了PLT结构中的一个固有代价,也为后续的性能谜团埋下了伏笔。

二、用“收益与代价”的天平来衡量每一圈循环

研究团队建立了一个清晰的分析框架:每多循环一圈,都伴随着“精炼收益”和“位置错配代价”的博弈。当收益大于代价,循环就是有益的;反之,就是有害的。

那么,如何量化这场博弈呢?团队从三个维度来剖析“收益”:

隐藏状态动态: 观察每圈后模型内部“词语向量”的变化。如果变化方向一致,说明模型在持续优化;如果方向反复颠倒,就像工匠在“修了改、改了修”,完全是无效劳动。

注意力热图演化: 观察模型每圈的关注点分布。如果每圈关注模式都大不相同,说明模型在捕捉新的上下文关系;如果几圈下来模式固化,说明信息流动已经“冻结”,再循环也无意义。

输出分布变化: 直接看模型对下一个词的预测变化有多大。变化越大,说明这一圈思考的实质性影响越强。

至于“代价”,团队定义了一个“内在偏移代价”指标,衡量相邻词语表示向量之间的平均差异。如果相邻词差异很大,那么把邻居的信息当成自己的信息用,失真就会很严重;反之则影响较小。

当把收益与代价曲线画在同一张图上(论文中的“增益-代价剪刀图”),一个鲜明的规律出现了:从第一圈到第二圈,收益虽然下降但仍处高位,代价基本稳定;但从第二圈开始,收益急剧萎缩,代价却坚如磐石。 代价成了固定的“税”,而收益这块“蛋糕”却越做越小。实验估算,从第三圈开始,每圈的偏移代价高达实际精炼收益的30到45倍。这完美解释了“二次循环”为何是黄金拐点。

三、在模型内部,每一圈到底在做什么

研究团队对训练了不同循环次数(1到4次)的模型进行了深度“解剖”,所有证据都指向同一个结论:第二次循环是真正的“黄金思考”,之后的循环贡献甚微,甚至有害。

从隐藏状态看: 追踪“步长”(变化幅度)、“角度变化”(优化方向一致性)、“有效秩”(语义多样性)和“固定点距离”(离稳定状态有多远)四个指标。数据显示,第二步的修改幅度最大、方向最一致。但从第三步开始,修改方向开始出现反向振荡,且词语表示的“有效秩”达到峰值后开始下降,这意味着模型的区分能力在减弱,语义空间被压缩了。

从注意力机制看: 注意力分布在第二次循环时变化最大,之后迅速“冻结”,不再产生新的信息流动模式。更严重的是,随着循环增加,本应各司其职的多个注意力头变得越来越“同质化”,做着同样的事,这是一种严重的功能冗余退化。此外,模型在所有循环中都严重依赖第一圈建立的全局缓存,后续循环并未带来多少新鲜信息。

从输出结果看: 虽然随着循环深入,正确答案的排名在单调上升(看起来在变好),但每次循环带来的提升在第二次之后急剧萎缩。第四次循环的输出变化,更像是模型在输出前做的一次“格式整理”,而非真正的“内容深化”。

四、来自真实战场的数字:2次循环的实力究竟有多强

理论再精巧,也需要实战检验。研究团队在一系列权威代码测评中进行了全面比拼,结果极具冲击力。

在代码生成任务(HumanEval+)上,2次循环版本得分84.1,优于1次循环的81.1,而3次循环则跌至75.0。在跨语言代码生成(MultiPL-E)上,也呈现同样趋势。

真正的亮点出现在自动化软件工程领域。在目前最权威、要求解决GitHub真实缺陷的SWEbench Verified测评中:

  • 1次循环(基础版):43.0分
  • 2次循环:64.4分(飙升21.4分)
  • 3次循环:27.6分(甚至低于基础版)

这个对比极具戏剧性。要知道,许多主流大模型在这个测评上表现平平。而2次循环的LoopCoder-v2(仅70亿参数)以64.4分的成绩,甚至超越了720亿参数的某顶尖模型(60.4分),与业界顶级模型(69.2-80.9分)的差距也并不遥远。这清晰地证明:通过更聪明的“思考”设计,小模型完全具备挑战巨头的潜力。

五、如果再加上“明说出来”的推理过程,效果会更好吗

上述实验是让模型“内部多想,但不说话”。那么,如果让它像人类一样“边想边说”(即输出思维链),效果会如何?

研究团队对比了“仅内部2次循环”和“2次循环+显式推理链”两个版本。结果发现,在推理密集型任务上,两者叠加产生了“1+1>2”的超加法效应。

例如,在考察实时代码竞赛能力的LiveCodeBench上:

  • 仅循环:35.4分
  • 循环+推理链:62.3分(提升26.9分)

关键在于,显式推理链和隐性循环工作在两个不同层面:前者在文字层面做宏观问题拆解,后者在向量层面对每个子问题进行微观精炼。它们互不重叠,分工协作,从而实现了效能的最大化。这为未来模型设计指明了一条高效路径:同时利用内部精炼和外部推理。

六、这个研究告诉我们怎么选择循环次数

当然,这些发现基于特定的PLT架构。研究团队也给出了一个实用的循环次数选择指南,无需穷举测试,只需观察一个关键指标:有效秩。

如果有效秩仍在上升,说明模型的表示多样性尚未饱和,增加循环可能还有收益;如果有效秩开始下降,则意味着后续循环只会让表示空间越来越窄,此时增加循环就是在为固定的位置错配代价“交税”,却买不到新的“精炼成果”。这是一个低成本、高效率的诊断方法。

对于PLT架构而言,2次循环是一个稳健且高效的默认值。想要在此基础上再进一步,更有效的方向或许是结合显式推理,或者探索更智能的、能动态调整位置偏移代价的机制。

说到底,这项研究像极了心理学中的“过度思考”现象:在某些决策中,快速直觉往往优于反复权衡,因为过度分析会让人陷入细节纠缠,丧失全局判断力。LoopCoder-v2的实验与之惊人相似:第二圈循环是清醒的再审视,抓住了关键;而第三圈及以后,则像是在焦虑中不断推翻已有判断,越想越乱。

这对整个AI领域具有重要启示。当计算和规模扩张遇到瓶颈时,如何设计“更深入思考”的机制是关键。简单地“多想想”并不总是有效,核心在于理解每次额外思考的真正贡献与代价。这项研究通过一套可解释的内部诊断方法,将“经验之谈”上升到了系统性的科学分析。

当然,研究也有其边界:所有结论基于PLT这一特定架构,其固有的CLP代价在其他循环设计中未必相同。此外,实验主要在代码任务上验证,在数学、多模态等其他领域是否存在类似的“思考饱和点”,仍有待探索。

Q&A

Q1:LoopCoder-v2是怎么在不增加参数的情况下提升性能的?

A:它采用了“循环Transformer”设计,让同一组核心参数被多次调用,每次调用都对信息进行深度精炼。结合并行循环Transformer(PLT)的优化机制,额外的循环几乎不增加实际延迟和内存开销,从而用接近相同的计算成本实现了更深入的“思考”。

Q2:为什么循环次数从2次增加到3次,LoopCoder-v2的表现反而会下降?

A:核心原因在于“收益-代价”失衡。CLP机制带来的“位置偏移代价”在每次循环中几乎固定,而每次额外循环带来的实质性精炼收益却快速衰减。从第三圈开始,代价远高于收益(约30-45倍)。同时,模型内部表示的多样性在第二圈后开始下降,后续循环反而在压缩其表达能力。

Q3:PLT循环模型的“思考版本”和普通版本有什么区别,为什么叠加使用效果更好?

A:普通版本只在内部隐性循环,不输出过程;“思考版本”则额外输出文字推理链。两者提升来自不同维度:隐性循环精炼微观理解,显式推理拆解宏观结构,两者互不干扰、协同增强,因此叠加后产生了远超单独使用的“超加法”效果。

本文内容来源于网友投稿,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

Mac软件 更多
photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。