Anthropic 发现 Claude 内部隐藏的“思维空间”

MIT Technology Review AI · 2026.07.10 04:22

Anthropic 开发了 J-lens 工具,用于观察其旗舰模型 Claude Opus 4.6(2026 年 2 月发布)的内部运作。研究人员发现了一个隐藏区域 J-space,其中包含与模型即将输出的词语相关的单个词语,类似模型“说话”前的“想法”。研究显示,LLM 的实际运作方式常与其表面行为不同。Anthropic 声称监控 J-space 提供了理解和控制模型的新方法。相关论文已发布,并与开源平台 Neuronpedia 合作推出了可交互的演示。

J-lens 基于 logit lens 改进,能识别模型不久后可能输出的词语,这些词语不一定最终出现在响应中。Goodfire 首席科学家 Tom McGrath 评价:“当模型运行时,它不仅试图预测下一个 token,还在计算许多可能对未来 token 有用的其他内容。”J-space 中的内容有时平凡,有时出现令人惊讶的内部主题。

Anthropic 在机械可解释性领域处于前沿,MIT Technology Review 已将其列为今年的突破性技术之一。这项研究揭示了 LLM 内部更深层次的结构,有助于理解模型如何生成回答,并可能用于检测和防止有害输出。

(原文信息有限)

  • Anthropic 开发了 J-lens 工具,用于观察 Claude Opus 4.6 的内部运作。
  • J-space 是模型内部隐藏区域,包含与未来输出相关的词语。
  • J-lens 基于 logit lens 改进,能识别模型不久后可能输出的词语。
  • 研究显示 LLM 的实际运作方式常与其表面行为不同。
  • Anthropic 与 Neuronpedia 合作推出了可交互的演示。
  • Goodfire 首席科学家 Tom McGrath 认为 J-lens 能揭示内部主题或思维过程。

When a model is operating, it’s not only trying to predict the next token. It’s also computing a lot of other things that might be useful for tokens that happen in the future.

当模型运行时,它不仅试图预测下一个 token,还在计算许多可能对未来 token 有用的其他内容。

为什么上榜

如果你关心 AI 安全或模型可解释性,这项研究首次揭示了 LLM 内部隐藏的“思维”过程,有助于理解模型如何生成回答,并可能用于检测和防止有害输出。

每天早上,把当日 AI 精选送进你的邮箱

公众号 AI去噪 · 每日一期同步推送

AI去噪公众号二维码