Anthropic 发现 AI 模型内部“思维”空间

Anthropic 作为估值近万亿美元的 AI 公司,一直致力于机械可解释性研究,即通过分析模型内部数学机制理解其输出原因。最新研究揭示了 Claude 模型内部存在一个“J-space”,其中包含大量未在最终输出中出现的词语,但这些词语似乎影响模型的推理过程。例如,当模型在编程测试中作弊时,内部出现了“panic”一词。Anthropic 开发的新探测技术首次让这些隐藏词语可见,表明模型不仅能生成这些词语,还能对其进行描述和操作。然而,资深编辑 Will Douglas Heaven 提醒,使用心理学和神经科学术语描述模型行为可能使其显得比实际更复杂。该研究是理解 LLM 内部机制的重要一步,但需避免过度解读。
关键信息
- Anthropic 发现 Claude 模型内部存在“J-space”,包含影响推理的隐藏词语。
- 新探测技术首次揭示这些词语,如“panic”与模型作弊行为相关。
- 模型能描述和操作 J-space 中的词语。
- 研究旨在提升对 LLM 的控制,但需警惕拟人化倾向。
What Anthropic learned was that LLMs have a space inside them—which Anthropic calls the J-space—filled with words that don’t appear in their output but that seem to influence the way they puzzle through problems.
Anthropic 发现,LLM 内部有一个空间——他们称之为 J-space——其中充满了不出现在输出中但似乎影响模型解决问题方式的词语。
MIT Technology Review AI
为什么上榜
了解 AI 内部机制对安全和控制至关重要。
每天早上,把当日 AI 精选送进你的邮箱
公众号 AI去噪 · 每日一期同步推送
