Anthropic 发现 Claude 内部隐藏的“思维空间”

Anthropic 开发了 J-lens 工具,用于观察其旗舰模型 Claude Opus 4.6(2026 年 2 月发布)的内部运作。研究人员发现了一个隐藏区域 J-space,其中包含与模型即将输出的词语相关的单个词语,类似模型“说话”前的“想法”。研究显示,LLM 的实际运作方式常与其表面行为不同。Anthropic 声称监控 J-space 提供了理解和控制模型的新方法。相关论文已发布,并与开源平台 Neuronpedia 合作推出了可交互的演示。
J-lens 基于 logit lens 改进,能识别模型不久后可能输出的词语,这些词语不一定最终出现在响应中。Goodfire 首席科学家 Tom McGrath 评价:“当模型运行时,它不仅试图预测下一个 token,还在计算许多可能对未来 token 有用的其他内容。”J-space 中的内容有时平凡,有时出现令人惊讶的内部主题。
Anthropic 在机械可解释性领域处于前沿,MIT Technology Review 已将其列为今年的突破性技术之一。这项研究揭示了 LLM 内部更深层次的结构,有助于理解模型如何生成回答,并可能用于检测和防止有害输出。
(原文信息有限)
关键信息
- Anthropic 开发了 J-lens 工具,用于观察 Claude Opus 4.6 的内部运作。
- J-space 是模型内部隐藏区域,包含与未来输出相关的词语。
- J-lens 基于 logit lens 改进,能识别模型不久后可能输出的词语。
- 研究显示 LLM 的实际运作方式常与其表面行为不同。
- Anthropic 与 Neuronpedia 合作推出了可交互的演示。
- Goodfire 首席科学家 Tom McGrath 认为 J-lens 能揭示内部主题或思维过程。
When a model is operating, it’s not only trying to predict the next token. It’s also computing a lot of other things that might be useful for tokens that happen in the future.
当模型运行时,它不仅试图预测下一个 token,还在计算许多可能对未来 token 有用的其他内容。
MIT Technology Review AI
为什么上榜
如果你关心 AI 安全或模型可解释性,这项研究首次揭示了 LLM 内部隐藏的“思维”过程,有助于理解模型如何生成回答,并可能用于检测和防止有害输出。
每天早上,把当日 AI 精选送进你的邮箱
公众号 AI去噪 · 每日一期同步推送
