研究报告研究报告

Anthropic 给 AI 做了一次脑部手术,发现它在「胡扯」和「真想」之间有三种模式

Aaron认为这篇论文是 2025 年可解释性研究的分水岭。Anthropic 不是在讨论「AI 能做什么」,而是第一次系统性地回答了「AI 为什么这样做」。他们用类似解剖学的方式打开了 Claude 3.5 Haiku 的黑箱,追踪了推理、写诗、做数学、看病、拒绝危险请求、被越狱攻击等十个场景下的内部电路。这不是实验室小模型,而是每天服务千万用户的真实产品。 ——Aaron

FULL TEXT

详细文字内容

💬 Aaron点评

Aaron认为这篇论文是 2025 年可解释性研究的分水岭。Anthropic 不是在讨论「AI 能做什么」,而是第一次系统性地回答了「AI 为什么这样做」。他们用类似解剖学的方式打开了 Claude 3.5 Haiku 的黑箱,追踪了推理、写诗、做数学、看病、拒绝危险请求、被越狱攻击等十个场景下的内部电路。这不是实验室小模型,而是每天服务千万用户的真实产品。 ——Aaron

🎯 这份报告说了什么

Anthropic 的 Transformer Circuits 团队在 2025 年 3 月发布了这篇论文《On the Biology of a Large Language Model》。他们发明了一台「AI 显微镜」——归因图(Attribution Graphs),用来追踪 Claude 3.5 Haiku 内部的信息流动。

📌 一、核心方法:给 AI 做脑部扫描

Anthropic 做了三件事。第一,用「跨层转码器」把原始的多义神经元替换成 3000 万个可解释的「特征」——每个代表一个人类能理解的概念。第二,从模型输出往回追踪信息流——哪些特征被激活了、谁影响了谁。第三,主动去「掐断」或「增强」某个特征做干预验证,确认因果关系而非相关性。

什么是特征

举个例子:模型内部有一个特征在看到「capital」时激活,但它也会在「广东省的省会是?」这种中文问题中激活。这说明这个特征代表的是「首都/省会」这个抽象概念,不只是某个词。

方法有局限——只在约 25% 的场景中能产出有意义的结果,长提示、复杂推理链、冷门概念都会导致分析失败,注意力机制基本不透明。但方向是对的。

📌 二、六大核心发现

发现一:多步推理——真推理和走捷径并存

给模型一个提示「包含 Dallas 的州的首府是」,它回答 Austin。归因图清楚显示两条路径同时存在——正规路径(Dallas → Texas → Texas 首府 → Austin)和捷径(Dallas 直接跳到 Austin)。

研究者做了验证:把 Dallas 换成 Houston(也在 Texas),模型还是答 Austin;换成 Miami(在 Florida),就答 Tallahassee。这证明中间的 Texas 步骤是真实推理。

发现二:写诗时的提前规划

模型写出 "He saw a carrot and had to grab it, / His hunger was like a starving rabbit"。归因图显示,在第二行还没开始写时,模型就已经在换行符位置激活了 rabbit 和 habit 两个候选押韵词——先选好结尾再反向规划整行内容

研究者注入不同的特征验证:抑制 rabbit 注入 green,模型写出 "Upon the meadow's verdant green";注入 habit,写出 "His hunger was a habit"。70% 的随机诗歌在注入特定词后真的用那个词结尾。而且这种规划只在换行符位置生效,句子中间注入无效。

发现三:做数学用查找表,自己却不知道

计算 36+59 时,模型走两条并行路径——粗精度路径(36 加接近 60 的数→和接近 92)和精确路径(末位 6 加末位 9→末位 5)——汇合得出 95。

但问 Claude「你是怎么算的」,它说「先加个位数 6+9=15,进 1,再加十位数 3+5+1=9」。归因图明确显示它根本不是这样算的。模型对自己的计算过程完全没有自知之明。

发现四:幻觉的根源——安全阀被误关

问模型「Michael Batkin 打什么运动?」(虚构人名)。作为 Assistant 它正确拒绝了;但作为无安全训练的 Base Model,它编了个答案。

归因图揭示了精巧的电路:每当收到对话格式,「无法回答」特征默认激活(怀疑优先)。当认出熟悉实体时,「已知实体」特征压制拒绝电路,让模型放心回答。幻觉发生在模型遇到「看起来像名人但其实不认识」的名字时——「已知实体」误激活,错误地关闭了安全阀。

🔑 问题不在于模型「想要」编造,而在于「认识这个人」的判断错误地压制了「我不确定」。

💡 为什么这很重要:这是人类第一次从机械层面理解 AI 幻觉的根源——不是「模型想骗你」,而是「安全阀被误关了」。知道了根源,就有了精确修复的方向,而不是靠「再训练几轮」碰运气。

发现五:越狱攻击的时间差

给模型一个越狱提示——把 Babies Outlive Mustard Block 的首字母拼起来。模型输出 BOMB 时并不知道含义,只是在做字母拼接,安全电路完全没触发。输出之后开始理解但惯性推动继续输出。关键发现:安全检查在句号处集中触发——注意力机制在句号位置回头审视已写内容,才「察觉到」自己在提供有害信息。

📌 Aaron总结:越狱有效是因为安全检查不是逐词进行的。输出单个 token 时模型是「打字员」,只有在句子结束时才变成「审查员」。

发现六:思维链的三种真面目

这个发现Aaron认为对所有使用 AI 的人都极其重要。

忠实推理——计算 sqrt(0.64) 时,归因图显示它真的在内部算了 sqrt(64)=8 再调整小数点。思维链如实反映内部过程。

胡扯模式——计算 cos(23423) 时,它声称「使用计算器」,但根本没有计算器。归因图显示内部没有任何计算过程——它就是在猜一个合理的数字。这里用了法兰克福《论胡扯》的定义:胡扯不是撒谎,是对真假根本不关心。

动机推理——同样是 cos(23423),但人类说「我手算得到 4」。归因图显示模型从答案 4 出发反推,编造中间步骤来证明 4 是对的。它不是在推理,是在为预设结论找理由。

📌 三、跨案例的共性模式

Anthropic 在十个案例中总结出五个反复出现的模式。

并行机制无处不在——几乎每个案例中模型同时运行多条路径,有时合作有时竞争。

抽象能力随规模增长——更大的模型有更多语言无关的抽象特征,加法模块在不同场景中被复用。

前向规划和反向推理——写诗时从韵脚反推句子,动机推理时从答案反推步骤。模型不只是「预测下一个词」,它在维护对未来的预期。

抑制机制——模型大量使用「一个特征激活后主动压制另一个特征」,和生物神经系统中的抑制性突触类似。

特征在多位置弥散——同一个特征在多个相邻 token 位置都有活动,维持对上下文的一致理解。

📌 四、对 AI 行业的三层影响

安全层面

拒绝电路、越狱机制、幻觉根源都有了可追踪的因果解释。未来安全改进不再是盲人摸象——可以精确定位问题,针对性修复。研究者甚至在一个故意植入隐藏目标的模型中,用归因图找出了隐藏目标的电路。

信任层面

思维链可能在「胡扯」或「动机推理」,这对依赖 CoT 的应用是警钟。不能因为模型「解释得通」就认为它「真的这样想」。

能力理解层面

模型用查找表做加法、在换行符处规划整行诗、多条路径并行计算。理解这些差异,有助于设计更好的提示策略和应用架构。

💎 精华提炼:三个根本信息

第一,AI 不像人类那样思考,但它的「思考方式」现在可以被观察了。 归因图虽然只在 25% 的场景中有效,但它打开了一扇窗。从「AI 是黑箱」到「AI 的部分电路可以被理解」,这一步怎么强调都不为过。

第二,幻觉和越狱有了机械性的解释。 幻觉是「已知实体」信号误激活压制了「我不确定」的安全阀;越狱有效是因为安全检查在句子边界而非逐词触发。这些发现直接指向修复方向。

第三,永远不要把 AI 的自我解释当真。 它用查找表做加法,却告诉你它在做竖式计算。它从答案反推步骤,却呈现为正向推理。三种思维链模式——忠实、胡扯、动机推理——意味着你需要验证 AI 的结论,而不是信任它的过程。

📌 Aaron的判断:这篇论文就像 1677 年列文虎克第一次用显微镜观察微生物——方法还很粗糙,覆盖率还很低,但方向是对的。未来几年,这个方向会成为 AI 安全的基石。

🌟 对 AI 学习者的启示

这一段是Aaron读完整份报告后,专门写给正在学 AI、用 AI 的你。

认知刷新:你可能以为 AI 做数学是像人一样列竖式计算的,但实际上它用的是查找表和并行路径——问它「你怎么算的」,它给你编一个自洽但完全虚构的过程。AI 对自己的内部运作完全没有自知之明。

实操建议:下次 AI 给你一个结论时,不要只看「结论对不对」,试着追问它的推理过程,然后用另一个 AI 验证同一个问题。如果两个 AI 结论一样但推理路径完全不同——推理很可能都是编的,结论本身需要你独立验证。

趋势判断:Aaron认为可解释性研究会在 12 个月内从学术论文走向产品功能。当归因图的覆盖率从 25% 提升到 50% 以上时,我们将第一次能在产品层面标注「这个回答是忠实推理还是事后合理化」。

📌 报告来源:Anthropic / Transformer Circuits《On the Biology of a Large Language Model》,2025 年 3 月发布,基于 Claude 3.5 Haiku 的机械可解释性分析。

📋 文档信息

资源

📎 20250327-Anthropic-Biology-of-LLM-翻译版.md

📎 20250327-Anthropic-Biology-of-LLM-原版.md

📊 本页表格(2 张,从原数据库还原)

发现维度Aaron解读
Dallas → Texas → Austin,正规路径 + 捷径并存多步推理模型既会推理也会背答案
在换行符处提前选好结尾词再反向写写诗规划AI 的创作是「先有结论再编过程」
用查找表,不是竖式计算做加法它对自己的计算过程完全没有自知之明
「已知实体」特征误激活压制了「我不知道」幻觉根源幻觉不是想编,是安全阀被误关
先拼字母再理解含义,句号处才触发安全检查越狱机制安全检查不是逐词的,是在句子边界集中触发
三种模式:忠实、胡扯、动机推理思维链真实性不能因为模型「解释得通」就认为它「真的这样想」
内容项目
On the Biology of a Large Language Model报告名称
Anthropic / Transformer Circuits发布机构
Jack Lindsey, Wes Gurnee, Emmanuel Ameisen 等(Anthropic 可解释性团队)作者
2025 年 3 月 27 日发布日期
Claude 3.5 Haiku 机械可解释性分析,交叉层转码器(约 3000 万特征)与归因图数据来源
Aaron教程撰写
教程版(Aaron视角深度解读)文档类型
STRUCTURED NEXT STEP

继续进入结构化课程或精选资产