OpenAI 发布 GPT-5.6 系列:Luna、Terra、Sol

Simon Willison · 2026.07.10 03:46

OpenAI 于 2026 年 7 月 9 日发布 GPT-5.6 系列模型,包括 Luna、Terra 和 Sol 三种尺寸,定价分别为每百万输入/输出 token 1/6、2.5/15、5/30 美元。所有模型知识截止日期为 2026 年 2 月 16 日,上下文窗口 100 万 token,最大输出 12.8 万 token。

在 Agents' Last Exam 基准测试中,Sol 以 53.6 分超越 Claude Fable 5(40.5 分),Terra 和 Luna 也以约十六分之一的成本超越 Fable 5。但 SWE-Bench Pro 上 Fable 5 以 80% 领先 Sol 的 64.6%。作者早期体验认为 Sol 在复杂编码任务上未明显优于 Fable。

新 API 功能包括程序化工具调用(允许模型编写 JavaScript 编排工具调用)、多智能体协作(模型可启动子智能体进行并行工作)和提示缓存断点(明确缓存位置)。这些功能可能改变应用构建方式。

  • OpenAI 于 2026 年 7 月 9 日发布 GPT-5.6 系列,包括 Luna、Terra 和 Sol 三种尺寸。
  • 定价分别为每百万输入/输出 token Luna $1/$6、Terra $2.50/$15、Sol $5/$30。
  • 所有模型知识截止日期为 2026 年 2 月 16 日,上下文窗口 100 万 token,最大输出 12.8 万 token。
  • 在 Agents' Last Exam 中,Sol 得 53.6 分,超过 Claude Fable 5 的 40.5 分。
  • 在 SWE-Bench Pro 中,Fable 5 得 80%,Sol 仅 64.6%。
  • 新 API 功能包括程序化工具调用、多智能体协作和提示缓存断点。

On Agents' Last Exam, an evaluation of long-running professional workflows across 55 fields, GPT-5.6 Sol sets a new high of 53.6, eclipsing Claude Fable 5 (adaptive reasoning) by 13.1 points.

在 Agents' Last Exam(一项横跨 55 个领域的长时间专业工作流评估)中,GPT-5.6 Sol 以 53.6 分创下新高,超越 Claude Fable 5(自适应推理)13.1 分。

为什么上榜

GPT-5.6 是 OpenAI 最新旗舰模型,定价和性能对比直接影响开发者选型,新 API 功能如多智能体和程序化工具调用可能改变应用构建方式。

每天早上,把当日 AI 精选送进你的邮箱

公众号 AI去噪 · 每日一期同步推送

AI去噪公众号二维码