Qwen3.8 Max登顶Agentic Index最佳整体模型

Hacker News · 2026.08.07 02:44

Artificial Analysis发布了最新的AI模型评估更新。其智能体指数(Agentic Index)中,Qwen3.8 Max被列为最佳整体模型。同一天,智能指数(Intelligence Index)升级至v4.1.1,该版本更新了𝜏³-Banking基准的版本,并将HLE、AA-LCR和AA-Omniscience的评分器升级为GPT-5.6 Luna(中等)。此外,还公布了Endpoint Accuracy Index,用于检验模型提供商的端点是否与参考模型质量一致。

在本次更新中,新评估了多个模型,包括Ling 3.0 Tiny、Muse Spark 1.2、G9v3-39A5B、DeepSeek V4 Flash 0731、Celeris-1、Inkling Small、Kimi K3 (low)等。同时,成本估算方法有所调整,导致成本绝对值上升,但相对排名影响不大。

这些更新反映了当前AI模型评估体系的快速演进。Qwen3.8 Max在智能体维度登顶,表明国产模型在智能体应用中的竞争力增强,也为开发者选择基础模型提供了新的参考依据。随着更多模型加入评测,排行榜的变动将更加频繁,用户需要持续关注最新数据以做出明智的决策。

  • Qwen3.8 Max在Artificial Analysis的Agentic Index中位列最佳整体模型
  • Intelligence Index升级至v4.1.1,引入GPT-5.6 Luna作为部分评估的裁判
  • 发布Endpoint Accuracy Index,衡量端点服务与参考模型质量的一致性
  • 新评估了Ling 3.0 Tiny、Muse Spark 1.2、DeepSeek V4 Flash 0731等模型
  • 成本估算方法更新,成本绝对值上升但相对排名影响小

Intelligence Index v4.1.1 moves 𝜏³-Banking to v1.0.1 and upgrades the grader for HLE, AA-LCR, and AA-Omniscience to GPT-5.6 Luna (medium)

智能指数v4.1.1将𝜏³-Banking移至v1.0.1,并将HLE、AA-LCR和AA-Omniscience的评分器升级为GPT-5.6 Luna(中等)。

为什么上榜

如果你在选智能体模型,这是最新的排行榜变化。

每天早上,把当日 AI 精选送进你的邮箱

公众号 AI去噪 · 每日一期同步推送

AI去噪公众号二维码