展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > Anthropic首次窥见AI的“大脑”内部,却发现理解它比想象中困难

Anthropic首次窥见AI的“大脑”内部,却发现理解它比想象中困难

Anthropic通过新工具J-lens在Claude模型中识别出隐藏表征空间J-space,其中信息不直接输出但参与复杂推理。抑制该空间会降低模型推理能力,但常规语言生成不受影响。研究借用认知科学全局工作空间理论进行功能类比,未证明存在意识。J-space或可用于监测异常行为,但解读需谨慎。


(来源:麻省理工科技评论)

Anthropic 这家公司,在 AI 圈子里一直有点“不一样”。估值逼近万亿美元,却总爱干些看起来不太“务实”的事——比如琢磨 AI 模型会不会有类似痛苦的体验,或者在系统发现用户滥用时主动中断对话。更让人意外的是,它把大量真金白银和时间砸进了一个叫“机械可解释性”的研究方向,说白了,就是想搞清楚 AI 模型到底是怎么运转的。

大型语言模型的能力越来越强,能写文章、能写代码、能分析复杂问题,但一个尴尬的问题始终没解决:人类造出了这样的系统,却说不清它为什么给出某个答案。模型通过海量数据自行学习语言和概念之间的关联,人们看到的只是最终输出,中间的过程是个典型的“黑箱”。

机械可解释性要做的,就是撬开这个黑箱,从模型内部复杂的数学结构中找出那些真正影响行为的关键机制。但一次输出背后可能涉及数百万个变量和无数的计算,想精准定位哪个部分起了作用,难度不亚于在沙子里找一粒特定颜色的玻璃珠。

这个方向本身就充满争议。研究人员经常借用心理学和神经科学里的概念来谈论 AI 模型——思考、记忆、推理,甚至意识。不少人担心,这类词汇容易让人高估系统的复杂程度,误以为它们拥有了更接近人类的思维能力。可问题是,除了这些词,人类好像也没什么更好的选择了。

最近,Anthropic 宣布找到了一种新方法,可以观察模型生成答案时内部那些隐藏的状态。消息一出,迅速引发关注,但这项研究究竟意味着什么,还需要谨慎看待。《麻省理工科技评论》资深编辑 Will Douglas Hea ven 长期追踪这一领域,他认为,Anthropic 的新发现固然值得关注,但同时也抛出了一个更根本的问题:当研究人员开始窥见模型内部的活动时,我们究竟看到了什么?又该怎么去描述它?



Anthropic 究竟发现了什么

Anthropic 研究 LLM 内部机制已经好几年了。CEO Dario Amodei 曾直言:如果人类无法深入了解大型语言模型的运行原理,就谈不上真正控制这些系统。

今年 7 月 6 日,Anthropic 可解释性团队在自家的 Transformer Circuits 研究平台发布了一篇论文,标题是《语言模型中的可语言化表征形成全局工作空间》,同时公开了研究说明和代码。为了观察模型内部究竟发生了什么,研究人员开发了一套名为 Jacobian lens(简称 J-lens)的新工具。借助它,他们在 Claude 的内部活动中识别出一组此前未被观察到的特殊表征,并将这些表征所在的空间称为 J-space。


图|J-space 示意图(来源:Anthropic)

按照论文估算,J-space 的规模并不大,占模型整体内部活动的比例不到十分之一,主要活跃在网络的中间层。研究人员发现,这里会出现一些不会直接进入最终输出的词语,但它们似乎与模型分析问题、组织答案的过程有关。在 J-lens 出现之前,这部分信息一直隐藏在模型内部。

不过,看到这些信息,并不能证明模型真的在使用它们。为了验证 J-space 的作用,研究人员进一步人为抑制了其中的内容。结果发现,Claude 依然能流畅地生成语言,也能完成大量常规的信息处理;但一旦遇到需要复杂内部推理的任务,表现就会明显下降。这说明,J-space 中的信息很可能真正参与了模型的推理,而不是计算过程中偶然留下的痕迹。


图|J-space 概念表征与干预实验结果(来源:Anthropic)

Anthropic 还发现,在一定条件下,语言模型能够描述并操控这些内部表示。模型在完成某些任务时,确实会利用 J-space 中的信息。但真正难以回答的问题也由此出现:研究人员似乎已经能够看到模型内部的一部分活动,却还很难准确描述这些活动究竟意味着什么。Claude 是在“思考”吗?J-space 中间出现的词语,能否被称为模型的“念头”?目前,人类还缺少一套足够准确的语言来回答这些问题。



我们甚至不知道该怎么描述 LLM

大型语言模型本身并不神秘,本质上是一套靠数学方法学会词语和概念之间关系的系统。只是当模型规模不断膨胀,内部的计算也变得难以追踪。如今的大型语言模型通常由数千亿个数字构成,运行一次就会触发数百万甚至数千万次计算。曾有研究者形容,把一个中等规模的 LLM 完整打印出来,纸张能铺满一座旧金山那样规模的城市。

面对如此庞大的结构,人类没法一条条翻阅模型内部的计算过程去找规律,只能靠专门的工具,在特定时间点观察模型内部特定区域的变化。可这些工具本身,又要求研究人员先对模型内部的数学结构有足够深入的了解。研究者常常卡在一个死循环里:要有工具才能看清模型内部在发生什么,可要设计出合适的工具,又得先弄懂模型是怎么回事。

Will Douglas Hea ven 不喜欢把 LLM 说成大脑。“大型语言模型不是大脑,”他说。这种说法容易让人误会,以为 AI 拥有更接近人类的能力,也容易让人顺着这种类比,对模型未来的行为做出没什么依据的推测。

AI 的拟人化倾向,一直伴随着围绕这项技术的种种争论。人们怎么描述 AI,往往也反映出他们怎么理解这项技术,以及觉得 AI 最终能走到哪一步。模型说错话被叫作幻觉,完成复杂任务被叫作推理,能持续保存的信息被叫作记忆。这些词原本是用来描述人的认知和行为的,如今成了讨论 AI 时最常用的词汇。它们让复杂的技术过程变得好懂,但也很容易让人联想到人类的心智活动。

话说回来,人类目前确实拿不出一套更准确的词汇。所以思考、理解这类说法虽然不够严谨,但在讨论复杂 AI 系统时却很难完全避开。

Anthropic 在这篇论文里,借用了认知科学里的一套理论框架。这套理论认为,人脑处理的信息里,绝大部分都是自动运行、没法被表达出来的,只有很小一部分能进入意识、被用来推理和支配行为,这在认知科学里叫“可通达意识”,跟更难验证的主观感受不是一回事。


图|Global Workspace 五项功能测试(来源:Anthropic)

Anthropic 发现,J-space 在功能上有点像这套理论描述的结构:模型内部绝大多数计算都读不出来,但 J-space 里那一小部分信息可以用语言表达,而且看起来确实参与了推理、影响了行为。研究人员借用这套理论,不是为了证明 Claude 有类似人类的大脑或意识,而是把它当作一件工具——认知科学关于全局工作空间的研究提出过一系列可以检验的功能特征,Anthropic 团队照着这些特征对 J-space 提出具体预测,再逐项做实验验证,其中一部分预测确实得到了印证。人类还没发展出专门描述大型语言模型的语言,但已有的理论至少能帮研究人员提问题、设计实验。

这种借用也划了明确的边界。Anthropic 强调,J-space 和这套理论之间的对照只停留在功能层面,并不能证明语言模型拥有和人类相同的意识或大脑结构,也没有证明 Claude 存在主观体验。



J-space 能解决什么问题

关于思考和意识的讨论很容易吸引眼球,但 J-space 更现实的价值,可能是在 AI 安全领域。

Anthropic 认为,监测 J-space 未来有可能成为发现模型异常行为的一种手段。J-space 里藏着一些不会直接反映在输出里的信息,这些信号或许能帮研究人员提前发现问题——例如模型正在形成带偏见的回答,或者在权衡要不要作弊。

目前,判断一个模型有没有问题,很大程度上还是靠看它最终输出的结果。可如果一个模型能藏住自己的意图,或者只在特定条件下才露出异常,光看最终结果未必能发现问题。J-space 提供了另一个观察角度:研究人员或许能在模型真正采取行动之前,就找到和这个行动相关的内部信号。

不过,必须警惕的是,仅凭 J-space 中间出现的词语,还不能判断模型接下来会做什么。panic 出现,不能证明 Claude 真的产生了恐慌。J-lens 目前只能捕捉模型内部的一部分信息。但如果未来的研究能够证明,某些内部信号总是与特定行为同时出现,研究人员或许就能利用这些信号,更早发现模型正在偏离预期。

这个思路已经有了一次初步尝试:研究人员训练 Claude 在对话被打断时,主动说清楚自己遵循的伦理原则,结果发现,即便没有专门针对正常对话做训练,模型在不被打断时的行为也跟着有所改善。这让研究人员觉得,J-space 除了提供观察内部信息的渠道,也许还可以通过影响这些信息,去调整模型在其他场景下的表现。

研究公布后,也出现了一些谨慎的声音。Gizmodo 记者 Mike Pearl 在论文发布当天就撰文提醒读者,不要对这类发现做过度解读。Anthropic 自己在论文里也承认,J-lens 并不是一件完美的工具,它看到的结果依赖具体的实验设计,目前还谈不上是对模型内部运作的完整解释。

即便 J-space 最终被证明具有普遍意义,它也很可能只是模型内部众多机制中的一部分。找到一个可以观察模型的窗口,并不意味着已经理解了整个系统。J-space 确实为研究人员提供了一条接近模型内部机制的新路径,但目前能够看到的仍只是其中有限的一部分。至于这些内部活动背后究竟对应怎样的计算过程,人类甚至还没有一套准确的语言来描述。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。