展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 马里兰大学等:让AI自己设计AI的"思考策略",推理效率提升近70%

马里兰大学等:让AI自己设计AI的"思考策略",推理效率提升近70%

马里兰大学等机构提出AutoTTS框架,让AI自主设计推理策略以优化“测试时扩展”。该框架通过离线回放环境、单参数化约束等设计,仅用少量成本自动搜索出高效策略。实验表明,新策略在多项任务中能以更低计算量获得更高准确率,其复杂机制超出人工设计范畴,展现了AI自我改进的潜力。


一项关于如何让AI“思考”得更聪明的研究,近期在学术圈引起了广泛关注。这项由马里兰大学、弗吉尼亚大学、华盛顿大学圣路易斯分校、北卡罗来纳大学、谷歌和Meta等多家机构联合完成的工作,已于2026年5月8日以预印本形式发布在arXiv平台,论文编号为arXiv:2605.08083。

想象一下,当你向朋友请教一道难题时,他有两种帮法:一是直接告诉你答案,二是自己先琢磨几遍,综合多个思路再给你一个更稳妥的答复。大型语言模型(也就是那些能写文章、解数学题的AI)面临的情况也类似。研究人员很早就发现,如果允许AI在解题时“多花点时间思考”——比如让它生成多个不同的推理过程,再从中挑选最优解——其表现会有显著提升。这种在“回答问题时投入额外计算资源”的技术,专业上称为“测试时扩展”。

但问题在于,如何分配这些额外的计算资源,长期以来一直依赖人工经验。研究人员需要手动规定:何时开辟新思路、何时砍掉无效路径、何时该停止并给出答案。这就像厨师凭感觉调味,配方因人而异,且难以解释其内在逻辑。而这项研究的核心突破,在于提出了一个名为AutoTTS的框架,让AI能够自主发现最高效的“思考策略”,从而摆脱对人类直觉设计的依赖。

一、为什么AI的“思考方式”值得专门研究

要理解这项研究的意义,不妨用一个备考的比喻来切入。

高考前,学生拥有固定的备考时间。他可以选择将所有时间押在一门学科上,也可以均匀分配,或是根据自身薄弱环节灵活调整。不同的时间分配策略,最终成绩往往天差地别。AI在回答问题时面临类似的抉择:它拥有一定的“计算预算”,可以选择同时探索多条推理路径,也可以让某条路径思考得更深入,或在过程中评估当前进展是否值得继续。

现有的方法大多基于研究人员的“经验设计”。例如,“自我一致性”方法会让AI同时生成64条推理路径,然后通过投票选出最普遍的答案——这好比让64个学生独立解题,再统计哪个答案出现次数最多。还有一些更复杂的方法,例如根据答案的稳定程度决定何时停止生成新路径,或在推理中途“剪除”看似偏离正轨的路径。

研究团队梳理这些方法后发现,它们都可以被视作在一个“宽度-深度”平面上移动的不同轨迹。宽度代表同时探索的路径数量,深度代表每条路径的延伸长度。64路自我一致性就是宽度拉满、深度固定的一个点;有些方法只调整宽度;有些只增加深度;还有些会先拓宽、再剪枝、最后深化。将这些方法置于同一张图中,它们就像棋盘上走出的不同路线。

这一视角揭示了一个关键洞察:这些人工设计的方法都只是“特殊案例”,其背后存在一个更广阔、尚未被充分探索的策略空间。既然大家都在同一个空间里探索,何不让AI自己去找出最优路线呢?

二、AutoTTS框架:让AI来设计AI的思考策略

AutoTTS的核心思路可以概括为“建造游乐场,而非亲手玩游戏”。

过去,研究人员直接设计一套思考规则交给AI使用。AutoTTS改变了这一分工:研究人员负责搭建一个“环境”——定义AI可以执行的动作、环境的状态以及何为好的结果——然后让另一个AI(探索者)在这个环境中自动寻找有效策略。

这一框架在设计上包含几个至关重要的技术决策,每一个都旨在解决实际的工程难题。

首先是构建“离线回放环境”。评估一个思考策略的好坏,通常需要实际运行AI来生成推理过程,这既耗时又昂贵。AutoTTS的解决方案是预先收集所有可能用到的推理数据:针对每道题目,提前让AI生成128条完整的推理路径,并每隔500个词元(token,可理解为AI处理的最小文字单位)记录一次当前的答案状态。建立这个数据库后,评估任何策略都无需再次调用AI——只需在已存储的数据上“回放”即可,就像通过比赛录像研究战术,而无需每次都重赛一场。这使得评估成本几乎可以忽略不计。

其次是“单参数化”(论文中称为beta参数化)。在早期试验中,探索者AI倾向于设计包含十几个可调参数的复杂策略。参数越多,搜索空间就越大,在有限的搜索轮次内极易导致过拟合——即找到的策略仅在用于搜索的那批题目上表现良好,换一批题目便失效。为解决此问题,研究团队强制要求所有策略只暴露一个参数β,其他所有内部参数都必须是β的确定性函数,且随着β增大,策略必须系统性地“更愿意投入计算资源”。这好比规定厨师只能用“辣度”一个旋钮来调整整道菜的风味,而非自由调节盐、糖、醋、辣椒的各自用量。这一约束极大地简化了搜索难度,并使发现的策略更加稳健。

第三个关键设计是“执行轨迹反馈”。仅仅告知探索者AI“该策略准确率为X%,消耗了Y个词元”,信息量远远不够——就像只告诉厨师“这道菜不好吃”,却不指出问题所在。为此,系统会记录每个策略在每道题目上的完整决策过程:何时开辟新路径、何时剪除某条路径、何时选择继续深化。这些细节被完整地反馈给探索者AI,使其能够诊断失败的具体原因,从而提出更具针对性的改进方案。

三、搜索过程:五轮对话,价值39.9美元

整个搜索过程的运作方式类似于一场五轮的头脑风暴会议,只不过参与者是AI。

搜索使用的题库是AIME24(美国数学邀请赛2024年真题),这是一套对AI而言颇具挑战性的数学竞赛题目。探索者AI是Claude Code(一款擅长编程的AI助手)。每一轮中,Claude Code都会审视之前所有策略的评估结果和执行轨迹,分析其优劣与存在问题,然后直接修改代码提交一个新策略。新策略随即在离线回放环境中接受评估,结果与轨迹再次反馈给Claude Code,进入下一轮。

五轮结束后,研究团队选出在AIME24上表现最优的策略并固定下来,随后在未参与搜索的题目上测试其泛化能力。整个过程总计花费39.9美元和160分钟。相较于人工设计所需的大量试验与调整,这一代价极低。

从搜索过程的轨迹图中可以观察到一个有趣的演化模式。第一轮提出的策略过于激进地削减计算,导致准确率大幅下降。察觉到这一问题后,第二轮策略显著增加了计算预算,使准确率得以回升。随后的几轮交替进行效率优化与准确率提升,整体轨迹朝着更优的“准确率-计算量”权衡点移动,而非单纯追求单一指标。

四、被发现的策略:四种人类未曾设想的机制

最终发现的策略被研究团队命名为“置信度动量控制器”(Confidence Momentum Controller, CMC)。分析其内部逻辑,可以识别出四种在人工设计方法中从未出现过的机制。

第一个机制是“基于趋势的停止”。人工设计的方法通常依据“当前时刻的答案一致程度”来决定是否停止——例如,若当前有90%的路径给出相同答案,便停止推理。但CMC采用的是“指数移动平均”(EMA,可理解为一种平滑处理,使近期信息比早期信息权重更高)来追踪置信度的变化趋势。其停止条件是:置信度平均值足够高,且该平均值未呈下降趋势。这意味着系统不会因某一轮偶然出现答案集中而过早停止——它需要确认这种集中是稳定的,而非昙花一现。

第二个机制是“宽度与深度的耦合控制”。在CMC中,是否开辟新推理路径(增加宽度)与是否深化现有路径(增加深度)并非独立决策,而是通过同一个置信度趋势信号相互关联。当置信度趋势强劲上升时,表明现有路径正在产生有效信息,无需开辟新路径;当趋势停滞或下降时,则说明当前路径陷入瓶颈,此时应开辟更多路径以引入新视角。这形成了一个自动反馈回路,而人工设计的方法通常对宽度和深度的控制是相互独立的。

第三个机制是“对齐感知的深度分配”。CMC将所有活跃的推理路径分为三类:与当前主流答案一致的路径、持续给出不同答案的路径,以及中性路径。对齐路径会获得更多推理步骤,因为它们正在为最可能正确的方向贡献信息;中性路径获得标准的一步推进;偏离路径同样只获得一步推进,但若连续多轮都与主流答案不同,便会被放弃。这种差异化的资源分配使计算更集中于“有希望的方向”。

第四个机制是“保守的路径放弃”。CMC不会轻易放弃任何一条路径,必须连续多轮保持偏离才会触发放弃,且无论如何都会保留至少两条活跃路径。这种保守性防止了在信息不足时过早收窄探索范围。

这四个机制协同工作,形成了一个比任何现有人工设计方法都更为复杂的协调系统。研究团队指出,这种复杂程度已超出了人类直觉设计所能合理达到的边界。

五、实验结果:在多个场景下超越人工方法

研究团队在四个不同规模的Qwen3系列模型(参数量分别为0.6B、1.7B、4B、8B,B代表十亿)上评估了AutoTTS发现的策略,同时测试了三个未参与搜索的题库:AIME25(2025年数学竞赛题)、HMMT25(哈佛-麻省理工数学锦标赛2025年题目)和GPQA-Diamond(研究生级别的科学问答)。对比的基线包括四种人工设计方法:自我一致性(SC@64)、自适应停止采样(ASC)、早停自我一致性(ESC)和并行探测(Parallel-Probe)。

在准确率-计算量的权衡方面,AutoTTS发现的策略在大多数场景下均优于所有人工基线。以1.7B规模模型在AIME25上的结果为例:所有人工方法的准确率均在44.4%左右,而AutoTTS在β=1.0时达到了49.0%,提升近5个百分点,同时使用的词元数量(592.6万)也处于合理范围。在β=0.5的低预算设置下,准确率为46.7%,词元数量仅为327.9万,比SC@64的1054.1万减少了近70%,但准确率反而更高。

在8B规模模型上,AutoTTS在β=0.5时便能以255.3万词元达到84.3%的AIME24准确率,而SC@64需要910.8万词元才能达到80.4%。换言之,用不到三分之一的计算量,获得了更高的准确率。

在泛化测试中,将该策略应用于DeepSeek-R1-Distill-Llama-8B(一个架构完全不同的模型)时,在HMMT25上同样超越了所有人工基线,表明发现的策略并非针对特定模型过度拟合的结果。在GPQA-Diamond这类非数学任务上,AutoTTS同样表现出色,β=0.5时仅用151万词元便达到41.6%的准确率,而SC@64需要510万词元才达到41.3%。

研究团队还进行了消融实验以验证各个设计选择的必要性。移除单参数化约束后,发现的策略出现严重过拟合,词元使用量从57.5万骤降至9.3万,但准确率从53.1%下降至49.0%——意味着策略学会了用极少的计算“蒙”答案,而非真正解题。移除执行轨迹反馈后,策略无法有效诊断失败原因,最终使用了过多的词元(82.4万 vs 57.5万)且准确率更低,说明单纯的“结果好坏”反馈并不足够。

六、这项研究意味着什么

归根结底,这项研究完成了一件在技术上看似绕弯、实则至关重要的工作:利用AI来帮助设计让AI变得更聪明的方法。

过去,研究人员设计一套新的推理策略需要大量的专业知识、试错和参数调整。AutoTTS将这一过程转变为可自动化执行的流程。更关键的是,它改变了人类需要投入精力的方向:从设计具体策略,转变为设计“发现策略的环境”。这就像从亲手绘制地图,升级为搭建一套制图系统——后者一旦建成,便可反复使用,并能探索人类手绘地图时从未想到的区域。

对普通用户而言,这项研究的直接影响在于:未来使用AI工具时,相同的计算成本有望换来更准确的回答,或是在保持相同准确率的前提下显著降低计算成本(即更快、更便宜的服务)。对AI领域的研究人员来说,该框架为“如何高效利用推理时的计算资源”这一问题开辟了一条新的研究路径。

当然,这项研究也存在明确的局限性。当前的实例化仅涉及宽度和深度两个维度的控制,而现实中的AI推理空间远比此复杂,例如树形搜索、验证器引导的迭代改进等方向均未纳入。此外,搜索过程依赖Claude Code这类前沿编程AI,若换用开源模型能否取得类似效果,目前尚不清楚。

这项研究也提出了一个有趣的思考方向:如果连“如何设计策略”这件事都能交给AI自动完成,那么下一步是否会让AI自动设计“发现策略的环境”本身?这种递归式的自我改进路径,目前仍远未被充分探索。

Q&A

Q1:AutoTTS框架和人工设计推理策略相比,主要优势是什么?

AutoTTS的主要优势有两点。第一是搜索效率极高,整个发现过程仅需39.9美元和160分钟,因为它利用离线预收集的推理数据来评估策略,无需反复调用AI生成新内容。第二是能发现人类直觉难以设想的策略,例如最终发现的CMC控制器包含四种协同工作的机制,其复杂程度超出了人工设计的合理边界。

Q2:beta参数化在AutoTTS中起什么作用?

beta参数化是一种约束机制,强制要求所有策略只暴露一个参数β,其他所有内部参数都必须是β的确定性函数。此举旨在防止过拟合——参数越多,策略越容易仅在搜索所用的题目上表现良好,更换题目后便失灵。单参数化大幅缩小了搜索空间,使发现的策略更加稳健,能够泛化到未曾见过的题目和模型上。

Q3:AutoTTS发现的策略能用于不同类型的AI模型和任务吗?

实验结果表明其具备泛化能力。研究团队将在Qwen3系列模型上发现的策略,直接应用于DeepSeek-R1-Distill-Llama-8B这一架构完全不同的模型,以及在GPQA-Diamond这类非数学的研究生科学问答任务上,其表现均优于或持平于人工设计的基线方法,说明策略具有一定的跨模型、跨任务泛化能力。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。