Cognition SWE-2 发布:性能、成本与训练创新

SWE-2 将编码代理的帕累托前沿推向新高度

Cognition 的新模型 SWE-2 在 FrontierCode 1.1 Main 基准测试中实现了 50.0% 的解决率——仅比领先模型 Fable 5.1 低一个百分点——同时运行成本降低了 64%。这一成果表明,单一模型可以在多个努力层级上同时主导成本-性能权衡曲线。


关键性能数据(数值越高越好,除非另有说明)

基准测试 SWE‑2 Kimi K3 Grok 4.6 Fable 5.1 GPT‑5.6 Sol GPT‑6 Astra SWE‑1.7
FrontierCode 1.1 Main 50.0 % 44.2 % 48.0 % 50.9 % 47.5 % 53.3 % 42.0 %
DeepSWE 1.1 73.0 % 68.5 % 67.5 % 67.4 % 72.7 % 74.1 % 37.7 %
Terminal‑Bench 2.1 92.8 % 88.3 % 88.4 % 91.4 % 88.8 % 89.9 % 81.5 %
Terminal‑Bench 4 27.3 % 21.5 % 20.3 % 55.8 % 37.3 % 57.9 % 7.6 %

SWE‑2 在所有基准测试中均优于其前代模型 SWE‑1.7,并在得分和成本上均击败了 Grok 4.6。它以远低于 GPT‑5.6 Sol 和 Fable 5.1 的价格达到相近性能,同时在成本仅为 GPT‑6 Astra 四分之一的情况下,仅落后其数个百分点。


SWE-2 如何实现更高智能与更低成本

1. 单次强化学习中融入帕累托信息的成本惩罚

  • 线性成本惩罚 – 奖励函数为 R = S – λₑ·C,其中 S 为二元成功,C 为回放成本,λₑ 根据基础模型在努力层级 e 的成本-性能曲线局部斜率进行调优。
  • 为何采用线性? – 附录 B 中的证明表明,只有仿射惩罚能确保期望奖励仅依赖于平均成本和解决率,而与回放分布无关。
  • 斜率匹配 – 将 λₑ 设为前沿曲线的斜率,使等奖励线与帕累托曲线相切,从而确保奖励提升的同时也推动前沿向外扩展。

“让 λₑ = m(局部斜率)可确保目标不受帕累托曲线上移动的影响,因此改进会直接将前沿向上推移。” – Cognition 博客

2. 长度加权奖励基线

  • 基线 b̂ = Σ Rᵢ·Lᵢ / Σ Lᵢ(按回放长度加权的奖励)在无需额外反向传播的情况下近似最优的方差减少基线。
  • 实证消融实验显示,推理策略与训练策略之间的 KL 散度显著降低,稳定了强化学习过程。

3. 强化学习回放服务与推测解码

  • DSpark 推测解码 – 草稿模型提出 token,由策略模型验证,使吞吐量提升 10–20%。
  • SpecForge 训练的草稿模型 – 将已接受 token 的长度延长约 15%,并在线更新以跟踪不断演化的策略。
  • 低精度 MoE 推理 – 使用 NVFP4/FP8 内核和量化感知训练,在保持 KL 对齐的同时降低内存使用。

4. 数据规模与验证器加固

  • 强化学习环境数量增加三倍,并扩展了代码库来源。
  • 添加了指令遵循叠加层,使模型在处理多个并行指令时仍能保持任务专注。
  • 实现了递归飞轮机制:使用中间检查点的回放结果来发现并修复验证器失败,减少奖励欺骗行为。

SWE-2 观察到的行为改进

  • 专注探索 – 首次编辑的中位数发生在第 18 步(SWE‑1.7 为 48 步),探索开销减少 62%。
  • 测试覆盖率 – 生成更全面的端到端测试,更早发现回归问题。
  • 资源丰富性 – 当所需集成不可用时,SWE‑2 可从现有上下文中重构所需数据(例如 Slack 历史记录)。
  • 验证纪律性 – 面对质疑时重新推导结论,运行证据收集工具,避免盲目同意。
  • 努力层级区分中等 努力层级在简单/中等任务上表现优异且成本低;最大 努力层级为复杂问题分配更多规划与验证资源。

可信度评估

Cognition 在六款模型(包括 SWE‑2)上重新运行了其内部的宣传/审查和上下文相关漏洞测试。结果如下:

  • 宣传与审查 – SWE‑2 总体通过率为 98.0%(英文 99.8%,简体中文 95.2%,繁体中文 99.1%)。
  • 上下文相关漏洞 – 无模型表现出统计显著的框架效应;SWE‑2 的平均漏洞偏移接近零,与其他模型相当。

Hacker News 社区反应

  • 对基准泛化能力的怀疑 – 一条高赞评论指出,Terminal‑Bench 2.1(92.8%)与 Terminal‑Bench 4(27.3%)之间存在巨大差距,暗示可能存在“基准最大化”现象。
  • 对 K3 后训练的担忧 – 部分用户质疑性能提升是否仅源于强大的 K3 基础模型,而非创新工程。
  • 开源权重与闭源权重的争论 – 多位评论者询问 SWE‑2 是否会以开源权重发布,将其与 DeepSeek Flash 4.1 等模型进行比较。
  • 产品体验 – 反馈不一:少数用户认为之前的 SWE‑1.7 不可用,而另一些用户报告 Devin(SWE‑2 的 UI)在拉取请求自动化方面提升了生产力。
  • 可用性 – 该模型目前可通过 Cognition 的 Devin Desktop、CLI、Web 和 Fusion 平台访问;尚未宣布开放路由器或第三方 API 集成。

此次发布对编码代理领域的影响

  • 成本-性能主导地位 – SWE-2 证明,一个经过多努力层级强化学习训练的单一模型,可同时实现顶级解决率和显著更低的每任务成本。
  • 方法论贡献 – 基于帕累托信息的线性成本惩罚提供了一种有原则、可复现的训练方法,适用于满足不同用户预算的模型。
  • 更广泛采用的潜力 – 如果 Cognition 开源权重或提供有竞争力的 API 定价,SWE-2 可能成为 Fable 5.1 或 GPT-6 Astra 等专有代理的可行替代方案。
  • 待解问题 – 社区仍不确定该模型在所列基准之外的真实世界泛化能力,以及模型的开放程度。

参考文献

  1. Lu et al., FrontierCode 1.1, 2026 年 7 月. https://cognition.com/blog/frontier-code-1.1
  2. Pan et al., SWE‑1.7: 以极低成本实现前沿智能, 2026 年 7 月. https://cognition.com/blog/swe-1-7
  3. Kimi Team, Kimi K3: 开放前沿智能, arXiv:2607.24653, 2026 年 7 月. https://arxiv.org/abs/2607.24653
  4. Kool et al., 买 4 个 REINFORCE 样本,免费获得基线!, ICLR 2019 工作坊. https://openreview.net/pdf?id=r1lgTGL5DE
  5. Greensmith et al., 强化学习中梯度估计的方差减少技术, JMLR 5, 2004. https://jmlr.org/papers/volume5/greensmith04a/greensmith04a.pdf
  6. Hao et al., 最优奖励基线的策略强化学习, arXiv:2505.23585, 2025 年 5 月. https://arxiv.org/abs/2505.23585
  7. Cheng et al., DSpark: 信心调度的推测解码, arXiv:2607.05147, 2026 年 7 月. https://arxiv.org/abs/2607.05147
  8. Li et al., SpecForge: 推测解码的高效训练, arXiv:2603.18567, 2026 年 3 月. https://arxiv.org/abs/2603.18567
  9. Cognition Team, 衡量开源衍生模型的可信度, 2026 年 7 月. https://cognition.com/blog/measuring-open-source-model-trustworthiness

Sources

相关