SWE-1.7 发布:低成本达前沿智能水平

Cognition 于 2026 年 7 月 8 日发布 SWE-1.7 模型,在 FrontierCode 1.1 Main 上达 42.3%(GPT-5.5 为 43.0%,Opus 4.8 为 46.5%),Terminal-Bench 2.1 上为 81.5%(对比 84.2% 和 86.9%),SWE-Bench Multilingual 上为 77.8%(对比 76.8% 和 84.4%)。模型基于 Kimi K2.7 进行强化学习训练,已在 Devin 平台通过 Cerebras 以 1000 TPS 提供服务。
训练中,Cognition 解决了熵坍缩和稳定性问题,采用 top-p 采样防止熵坍缩,并修复训练与推理间的 KL 散度不匹配。训练跨三大洲多集群,通过对象存储传输权重更新,并构建容错机制。数据方面,建立自动化执行测试管道,过滤低学习信号任务并防止奖励黑客。针对长周期任务,模型学会自我压缩工作状态并从摘要恢复,结合交替长度惩罚激励简洁输出。
SWE-1.7 从已进行大量 RL 后训练的 Kimi K2.7 训练而来,额外提升挑战了“后训练天花板”概念,表明 RL 可进一步推动能力。模型特别优化了长周期异步任务。对行业而言,SWE-1.7 展示了低成本达到前沿性能的可行路径,可能影响未来模型开发方向。
关键信息
- SWE-1.7 在 FrontierCode 1.1 Main 上达 42.3%,接近 GPT-5.5 的 43.0% 和 Opus 4.8 的 46.5%。
- 模型基于 Kimi K2.7 进行强化学习训练,成本更低。
- SWE-1.7 已在 Devin 平台通过 Cerebras 以 1000 TPS 提供服务。
- 训练中采用 top-p 采样防止熵坍缩,并修复 KL 散度不匹配。
- 训练跨三大洲多集群,通过对象存储传输权重更新,并具备容错机制。
- 模型学会自我压缩工作状态以扩展长周期任务能力。
It reaches frontier-level intelligence at a much lower cost, advancing the cost-performance Pareto curve.
它以更低的成本达到前沿智能水平,推动了成本-性能帕累托曲线。
Hacker News
为什么上榜
如果你关注 AI 编程助手或模型成本效率,SWE-1.7 展示了通过强化学习在较低成本下达到前沿性能的可行路径,可能影响未来模型开发方向。
每天早上,把当日 AI 精选送进你的邮箱
公众号 AI去噪 · 每日一期同步推送
