Claude Fable 5 在 NP-Hard 问题上碾压 GPT-5.6 Sol

Hacker News · 2026.07.18 19:00

作者在 Hacker News 上发布了一篇博客,对比测试了 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol 等模型在 NP-Hard 问题上的表现。测试问题 KIRO 是一个光纤网络设计问题,源自 2018 年工程学生竞赛,要求将终端连接到分布枢纽,形成冗余环路,目标是最小化总电缆长度。搜索空间极其巨大:仅巴黎子问题,即使忽略顺序和分支,也有 11^532 种分配方式;在一种受限解族中,搜索空间约为 10^1223。

实验设置:每个模型运行 30 分钟,有/无原生 /goal 模式,使用 Harbor 0.1.43 和 Docker。结果:Fable 5 在所有模型中表现最佳,不仅找到最优解,而且一致性极高,作者称“从未见过模型在此问题上有如此表现”。GPT-5.6 Sol 表现也不错,但不如 Fable 5。/goal 模式并非通用“更努力”开关:它改变了控制循环和搜索路径,有时能找到更好解,有时却让错误想法深化。

背景:作者多年前曾用 C++ 解决此问题,因此有可靠的人类基线。此次测试是前一篇基准文章的后续,所有代码、提示词、结果表格和轨迹已公开在 CLIArena。

  • Claude Fable 5 在 NP-Hard 光纤网络设计问题 KIRO 上取得最优解,一致性远超其他模型。
  • GPT-5.6 Sol 表现次之,但不如 Fable 5。
  • /goal 模式并非万能,有时改善结果,有时反而有害。
  • 搜索空间极大:仅巴黎子问题就有约 10^1223 种可能解。
  • 所有实验代码、提示词和结果已在 CLIArena 公开。

Fable 5 was an absolute beast on this benchmark. It produced the best solution overall, and its consistency is unlike anything I have seen from a model on this problem.

Fable 5 在这个基准测试中绝对是一头猛兽。它整体上产生了最好的解决方案,其一致性是我从未在任何模型上见过的。

为什么上榜

Fable 5 在极端复杂优化问题上展现超强能力,直接影响 AI 推理上限评估。

每天早上,把当日 AI 精选送进你的邮箱

公众号 AI去噪 · 每日一期同步推送

AI去噪公众号二维码