展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 大语言模型的"内心独白"到底有没有真正在思考?

大语言模型的"内心独白"到底有没有真正在思考?

不列颠哥伦比亚大学研究团队提出四条公理评估大语言模型的内部潜在思维表示质量。对五个开源模型检测发现,当前方法在因果性、最小性、可分性上表现不佳,任务内可分性近乎随机猜测,存在结构性缺陷,表明潜在思考多为“表演”而非真正推理。

当你在使用ChatGPT或其他大语言模型时,有没有想过一个问题:这些模型在给出答案之前,脑子里到底发生了什么?它们是真的在“思考”,还是只是在表演思考的样子?这个问题听起来像哲学讨论,但实际上有着非常实际的技术意义。近年来,AI研究圈里有一股热潮,就是想让模型不再用文字一步一步地写出思考过程,而是把这个过程“藏”在一种叫做“潜在表示”的数学向量里——说白了,就是让模型用一种人类看不懂的内部语言来思考,然后直接给出答案。这样不仅更快,理论上还可能更聪明。

然而,这个“潜在思考”到底靠不靠谱,一直缺乏一套科学的评估标准。大家评价模型好不好,几乎都只看最终答案的准确率——答对了,就说明思考过程没问题。但这就像评价一个厨师做菜,只尝最终成品,从不看他是不是真的在厨房里认真炒菜,还是把外卖装进自己的盘子里端出来。

不列颠哥伦比亚大学的研究团队决定打开这个“厨房”,看看模型的内部思考过程——也就是“潜在思维表示”——到底是否货真价实。他们设计了四条标准(称为“公理”),并开发了一套可以直接测量这些内部表示质量的工具,完全不依赖最终答案的对错。这是一个此前从未有人系统做过的事情。他们对五个主流开源大语言模型进行了全面检测,结果令人大跌眼镜。

一、为什么“答对了”不等于“真的在想”

要理解这项研究的意义,先得搞清楚一个关键区别:表演思考和真正思考。

在AI领域,有一种技术叫做“思维链”,就是让模型在回答问题之前,先一步一步地用文字写出推理过程,比如“首先,这道题要求我计算……其次,根据公式……最终得到答案……”。这种方式让模型的表现提升了很多,但有个明显的缺点:太慢太占资源。每生成一个字都要消耗计算资源,写一大段推理过程下来,成本很高。

于是研究者们想到一个办法:能不能让模型不用写出这些文字,而是把推理过程“压缩”成一个内部的数学向量,直接在脑子里完成?这就是“潜在思维表示”的概念。好几个前沿研究成果,比如COCONUT、Soft Thinking等,都在朝这个方向努力,并且在某些基准测试上报告了不错的准确率。

问题在于,准确率高,并不能证明这个内部表示真的在“思考”。现有的评估体系存在一个根本性的混淆:它把“表示的质量”和“模型的能力”搅在了一起。一个模型即便它的内部思考表示一团糟,只要它足够聪明,可能依然能蒙对答案。反过来说,如果一个模型在某道题上答错了,你也没办法判断是内部表示出了问题,还是后续的解码过程出了问题。这就像一个学生考试不及格,你不知道是他没理解题目,还是理解了但表达有误。

这个混淆导致了一个严重的后果:研究者们在优化这些“潜在思考”方法时,根本不知道自己优化的是什么,也不知道瓶颈在哪里。

二、四条诊断标准:给“思考质量”建立体检指标

不列颠哥伦比亚大学的研究团队提出了一套完全独立于最终答案准确率的评估框架,核心是四条“公理”。可以把这套框架理解为一套对大脑的“体检报告”,每条公理对应一个具体的健康指标。

第一条叫做“因果性”。一个有效的内部思考表示,必须真的能够替代显式的推理步骤,对最终答案的生成产生实质影响。研究团队的测量方法是:把模型正在生成的答案分成前半段(推理过程)和后半段(最终结论),然后把前半段的文字替换成对应的“潜在表示”向量,看看后半段的概率分布有没有变化。如果替换后模型生成后半段的方式几乎没变,说明这个潜在表示确实传递了推理信息;如果变化很大,说明这个向量根本没有承载推理内容。

第二条叫做“最小性”。一个好的内部表示,应该只保留和答案相关的信息,过滤掉无关的噪音。这来自一个经典的信息论概念:信息瓶颈原理。打个比方,如果你问模型“13是质数吗”,但同时给了它一大段关于莎士比亚的文字,好的内部表示应该只记录“质数判断”相关的内容,把莎士比亚的部分丢掉。研究团队用一个数学替代指标来估算这个“有效压缩度”,数值越高,说明表示越干净。

第三条叫做“可分性”。不同的问题,应该在内部表示空间里分开站着;相似的问题,应该站得近一些。这就像你把一群人按职业分组站队——厨师站一块儿,工程师站一块儿——好的内部表示应该能让模型自然地把不同类型的问题区分开。研究团队训练了一个“辨别器”——一个简单的分类器——来测试这种可分性:这个分类器能不能通过看内部表示,判断两道题是不是来自同一类任务,或者是不是同一道题?

第四条叫做“稳定性”。对于同一道题,就算答案的表达方式不同(比如一个说“13是质数”,另一个说“13不能被整除”),内部表示应该是相似的;而如果模型自己对一道题拿不准,内部表示应该能反映出这种不确定性。研究团队用一种叫做“语义熵”的工具来衡量:当模型对同一道题生成多个不同答案时,这些答案在意义上是否相似?内部表示能不能预测这种“拿不准”的程度?

这四条标准有一个重要的理论保障:研究团队在论文附录中严格证明了,这四条是相互独立的——违反其中任何一条,并不会自动违反其他三条;而且这四条合在一起,理论上足以完整描述一个“好的”内部思考表示所应具备的性质。

三、被检测的“思考”方法们

确定了评估标准之后,研究团队选取了几类主流的“潜在思维”方法作为检测对象,并在五个开源大语言模型上展开实验。

被检测的方法主要分成几大类。第一类是最简单的基准:直接取模型在处理完输入之后、开始生成答案之前,最后一个位置的隐藏层状态——这个向量编码了模型对输入的全部理解。第二类是“软思考”:不再生成离散的文字token,而是在每一步生成一个所有可能词汇的加权平均向量,相当于把“所有可能的下一个词”混在一起,形成一个连续的向量。第三类是带噪声的软思考:在上面的基础上加入随机扰动,鼓励模型探索更多可能性。第四类是“潜在思考”:借鉴COCONUT的思路,让模型在潜在空间里迭代更新一个状态向量,类似于在脑子里反复推演。

被测试的五个模型覆盖了当前主流的几大类型:参数规模较小的Llama-3.1 8B,参数规模较大的Llama-3.3 70B,经过强化学习专门训练推理能力的DeepSeek-R1-Distill-Qwen 32B和Skywork-OR1 32B,以及混合专家架构的GPT-OSS 20B。选这五个模型,是为了覆盖“密集型”、“稀疏混合专家型”、“推理蒸馏型”、“原生强化学习型”等不同范式,看看结论是否具有普遍性。

测试所用的基准是Big Bench Extra Hard,一个包含23类推理任务的高难度基准,涵盖空间推理、事实问答、逻辑推理、数学计算等多种类型,每类任务都有若干具体问题。整个实验共涉及4520道题,每道题生成8个候选答案(通过束搜索),形成一个庞大的评估数据集。

四、检测结果:潜在思维大面积“假装在思考”

检测结果出来之后,研究团队形容其为“暴露了大面积的表示性崩溃”。具体来看,情况是这样的。

在因果性维度上,所有被测试的“潜在思维”表示都比随机向量好得多——说明它们至少确实携带了一些和答案相关的信息。但是,没有任何一种方法显著超过“直接使用输入嵌入”这个最基础的基准。换句话说,把问题本身的文本直接嵌入向量,其对答案生成的预测能力,和那些精心设计的“思考”过程不相上下。模型在经历了所谓的“思考”之后,对答案的预测能力并没有比“直接看题”好多少。

在最小性维度上,结果参差不齐。不同模型、不同方法之间有差异,但总体来看,没有任何一种方法能稳定地超过输入嵌入基准。软思考类方法表现略好,但最后一个输入token的隐藏状态反而比基准更差——说明这个向量包含了大量输入相关但和答案无关的冗余信息。

最戏剧性的结果出现在可分性维度。研究团队测试了两种情况:跨任务分辨(能不能区分“这是一道数学题”和“这是一道空间推理题”)和任务内分辨(能不能区分同一类任务里的两道不同题目)。跨任务分辨几乎所有方法都接近满分,连随机向量加一个简单分类器都能轻松区分不同类型的任务——说明这根本不是个有挑战性的测试。

但任务内分辨的结果让人惊掉下巴:除了直接用答案文本生成的“输出嵌入”之外,所有方法的得分都在50%左右——和随机猜测没有区别。也就是说,面对同一类任务里的两道不同题目,模型的内部“思考”表示无法区分它们。同一类23道数学题,模型的内部状态对每道题都长得差不多,完全无法告诉你这道题和那道题有什么不同。研究团队在附录中进一步分析了几何结构,证明这种失败不是分类器太弱导致的,而是内部表示本身在同一任务内的几何结构过于“扁平”,几乎所有题目的表示都挤在一起,没有足够的分布维度来区分不同实例。即便换用参数量大十倍的分类器,结论也完全一样。

在稳定性维度上,结果相对好一些。多数模型的潜在表示能以较高的准确率预测“这道题模型是否会给出不同的答案”——说明内部表示确实在一定程度上编码了模型的不确定性。但有一个值得注意的现象:直接使用题目文本的输入嵌入,其稳定性得分有时候等于甚至超过那些经历了复杂“思考”过程的方法。这意味着,模型对一道题有没有把握,光从题目本身就能基本预测到,并不需要内部的思考过程来揭示。

五、迭代“思考”步数越多越糟糕

研究团队还考察了一个有趣的问题:给模型更多的“思考步数”,会不会让内部表示更好?毕竟,让模型在潜在空间里多迭代几轮,直觉上应该能积累更丰富的信息。

结果恰恰相反。对于软思考和潜在思考这两类方法,当思考步数从1增加到128时,在综合四个维度的评估中,表现反而系统性地下滑。在稳定性维度,迭代越多,得分下降越明显,对于潜在思考方法尤其显著。在可分性的几何分析中,随着步数增加,模型内部表示的“任务内参与比”确实提升了(说明向量展开到了更多维度),但与此同时,各维度上的有效信号密度却在下降——更多的维度在做“噪声铺垫”,而不是承载有意义的信息。

这个发现对于那些追求“更多思考步数=更好”的设计思路来说是个警醒:在没有适当约束的情况下,让模型在潜在空间里迭代更多轮,并不能自动产生更有质量的思维表示,反而可能让信息逐渐扩散和稀释。

六、这套诊断工具意味着什么

这项研究的核心贡献是提供了一把尺子,而不是一个答案。研究团队没有说“哪种方法最好”,因为目前没有任何一种方法能同时满足所有四条标准。他们提供的是一个分诊系统:当你开发了一种新的“潜在思维”方法,你可以用这套工具来知道,自己在哪个方向上进步了,在哪个方向上还有缺口。

这解决了一个长期困扰研究者的问题。过去,改进一种方法后,往往只能看到基准测试准确率的变化——但这个变化可能来自推理能力的提升,也可能来自解码策略的改变,还可能是训练数据碰巧覆盖了测试题。四条公理提供了正交的诊断维度:如果准确率提升但因果性没提升,说明问题出在解码,不在思考表示本身;如果可分性很低,说明需要在训练目标上施加约束,让内部状态能够区分不同的问题实例。

研究团队还特别检验了一个关键问题:这种任务内可分性的崩溃,是不是因为某些任务本身太难,导致模型的输出分布就没有区分度?如果是这样,那问题出在模型能力而不是表示质量。他们把任务内可分性得分和每个任务的基准准确率做了相关性分析,发现两者几乎没有关系(相关系数约为0.10,统计上不显著)。难的任务和简单的任务,内部表示的可分性同样低。这排除了“任务难度”的解释,进一步说明问题是结构性的,存在于所有类型的任务中。

七、失败是普遍的,不是偶然的

或许这项研究最令人警醒的发现,是这些失败模式在所有五个模型上都一致出现,无论是小模型还是大模型,无论是通用指令微调模型还是专门为推理优化的强化学习模型。DeepSeek-R1-Distill-Qwen 32B和Skywork-OR1 32B经过了专门的推理训练,按理说应该在内部推理表示上表现更好,但在这套框架下,它们的表现与普通的Llama模型几乎没有区别。

研究团队由此得出结论:这种失败不是某个模型或某个训练方法的特有问题,而是当前“潜在思维”技术路线的结构性缺陷。目前的方法在提取和利用内部表示时,都没有针对“区分同一任务内不同问题实例”这一能力进行明确优化,导致内部表示无论多么复杂,都退化成了“知道在做什么类型的任务”,而不是“知道在做这道具体的题目”。

这就好像一个助理能够区分“这是数学作业”和“这是语文作业”,但拿到两道数学题时,脑子里对两道题的“理解”长得一模一样——自然就会在具体的计算步骤上出错或混淆。

说到底,这项研究告诉我们,当前那些声称模型在“潜在空间中思考”的技术,很可能是在表演思考,而不是真的在进行有实质内容的推理。这套评估框架的价值在于,它让这种“表演”变得可以被量化和检测,而不再是玄学。对于普通用户来说,这意味着在AI宣称自己“想清楚了”的时候,我们需要更谨慎地对待这种说法;而对于研究者来说,这四条公理提供了明确的优化靶点,指向了让AI真正“思考”而不是模拟思考的技术路径。

有兴趣深入了解完整研究方法和实验数据的读者,可以通过arXiv编号2606.27378查阅原论文全文。

Q&A

Q1:什么是“潜在思维表示”,为什么它比普通的文字推理更受关注?

A:潜在思维表示是让AI模型在内部用数学向量完成推理过程,而不是像普通思维链那样一步一步写出文字。之所以受关注,是因为这种方式理论上更快、更省资源,而且不受人类语言表达限制,可能捕捉到更复杂的推理结构。但不列颠哥伦比亚大学的研究发现,目前的潜在思维方法在质量上存在严重缺陷,无法通过因果性、最小性、可分性、稳定性四项关键指标的检验。

Q2:为什么光看准确率不够,还需要专门评估内部表示的质量?

A:准确率只能告诉你最终答案对不对,却无法区分“模型真正理解了问题并推理出答案”和“模型恰好蒙对了答案”这两种情况。研究发现,模型可以在基准测试上得高分,但其内部的思维表示却无法区分同一类任务中的不同题目,说明内部“思考”过程并没有真正携带题目的具体信息。只有独立于准确率的评估工具,才能诊断出这种隐藏的失败。

Q3:增加模型的思考步数,为什么反而会让潜在思维质量下降?

A:当模型在潜在空间中迭代更多步时,向量确实扩展到了更多维度,但这些新增的维度大多承载的是噪声,而不是有效信息。结果是向量变得更“宽”但信号密度更低,稳定性和可分性都随之下降。这意味着单纯增加思考步数,在没有针对性训练约束的情况下,并不能让模型“想得更清楚”,反而可能让内部状态变得更模糊。

本文内容来源于网友投稿,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

Mac软件 更多
photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。