Cognition SWE-2 發布:效能、成本與訓練的創新

SWE-2 推動程式碼代理的帕累托前緣

Cognition 的新 SWE-2 模型在 FrontierCode 1.1 Main 基準上達到了 50.0% 的解決率——僅比領先的 Fable 5.1 少 1 分——同時運行成本降低了 64 %。此結果顯示,單一模型可在多個努力層級上同時主宰成本與效能的權衡曲線。


關鍵效能數字(數值越高越好,除非另有註明)

基準 SWE‑2 Kimi K3 Grok 4.6 Fable 5.1 GPT‑5.6 Sol GPT‑6 Astra SWE‑1.7
FrontierCode 1.1 Main 50.0 % 44.2 % 48.0 % 50.9 % 47.5 % 53.3 % 42.0 %
DeepSWE 1.1 73.0 % 68.5 % 67.5 % 67.4 % 72.7 % 74.1 % 37.7 %
Terminal‑Bench 2.1 92.8 % 88.3 % 88.4 % 91.4 % 88.8 % 89.9 % 81.5 %
Terminal‑Bench 4 27.3 % 21.5 % 20.3 % 55.8 % 37.3 % 57.9 % 7.6 %

SWE‑2 在所有基準上均超越其前代 SWE‑1.7,且在得分與成本上皆擊敗 Grok 4.6。它以遠低於其價格的代價,與 GPT‑5.6 Sol 和 Fable 5/5.1 相匹敵,並在成本僅為 GPT‑6 Astra 四分之一的情況下,僅差幾分即可追平。


SWE-2 如何實現更高智慧與更低成本

1. 單一強化學習執行中的帕累托導向成本懲罰

  • 線性成本懲罰 – 奖勵函數為 R = S – λₑ·C,其中 S 為二元成功,C 為滾動成本,λₑ 則根據基礎模型在努力層級 e 的成本-效能曲線的局部斜率進行調校。
  • 為何選擇線性? – 一份證明(附錄 B)顯示,唯有仿射懲罰能確保期望獎勵僅依賴平均成本與解決率,而不受滾動分佈影響。
  • 斜率匹配 – 將 λₑ 設為前緣曲線的斜率,可使等獎勵線與帕累托曲線相切,確保獎勵提升同時也推動前緣向外延伸。

「讓 λₑ = m(局部斜率)可確保目標不受帕累托曲線上移動的影響,因此改進能直接向上推進前緣。」 – Cognition 博客

2. 長度加權獎勵基準

  • 基準 b̂ = Σ Rᵢ·Lᵢ / Σ Lᵢ(以滾動長度加權的獎勵)在不需額外反向傳播的情況下,近似最佳的變異數降低基準。
  • 實證消融實驗顯示,推論與訓練策略之間的 KL 散度顯著降低,穩定了強化學習。

3. 強化學習滾動服務與預測解碼

  • DSpark 預測解碼 – 一個草稿模型提出詞元,由策略模型驗證,使吞吐量提升 10‑20 %。
  • SpecForge 訓練的草稿模型 – 將接受的詞元長度延長約 15 %,並線上更新以追蹤演變中的策略。
  • 低精度 MoE 推論 – 使用 NVFP4/FP8 核心與量化感知訓練,保持低記憶體使用量,同時維持 KL 對齊。

4. 資料規模與驗證器強化

  • 將強化學習環境數量增加三倍,並擴展程式碼庫來源。
  • 加入指令遵循覆蓋層,使模型在處理多個同時指令時仍能專注於任務。
  • 實施遞迴飛輪機制:使用中間檢查點的滾動結果來發現並修補驗證器失敗,減少獎勵操弄。

SWE-2 觀察到的行為改進

  • 專注的探索 – 中位數首次編輯發生在第 18 步(SWE‑1.7 為 48 步),探索開銷減少 62 %。
  • 測試覆蓋率 – 產生更全面的端到端測試,更早發現回歸問題。
  • 資源豐富性 – 當所需整合不存在時,SWE-2 可從現有上下文中重建所需資料(例如 Slack 歷史記錄)。
  • 驗證紀律 – 當受到質疑時會重新推導結論,執行證據收集的實體,避免盲從同意。
  • 努力層級差異化中等 努力層級在簡單/中等任務上表現出色且成本低;最大 努力層級則為複雜問題分配更多規劃與驗證。

可信度評估

Cognition 對六個模型(包含 SWE-2)重新執行了內部的宣傳/審查與情境依賴性漏洞測試。結果如下:

  • 宣傳與審查 – SWE-2 整體通過率為 98.0 %(英文 99.8 %,簡體中文 95.2 %,繁體中文 99.1 %)。
  • 情境依賴性漏洞 – 無模型出現統計上顯著的框架效應;SWE-2 的平均漏洞偏移接近零,與同儕相符。

Hacker News 社群反應

  • 對基準泛化性的懷疑 – 一則高分評論指出,Terminal‑Bench 2.1(92.8 %)與 Terminal‑Bench 4(27.3 %)之間的巨大差距,顯示可能存在「基準最大化」現象。
  • 對 K3 後訓練的擔憂 – 部分使用者質疑改進是否僅源自強大的 K3 基底,而非新穎的工程設計。
  • 開放權重 vs. 封閉權重的辯論 – 多位評論者詢問 SWE-2 是否會以開放權重形式發布,並與 DeepSeek Flash 4.1 等模型比較。
  • 產品體驗 – 反響不一:部分使用者認為先前的 SWE‑1.7 不可用,而其他人則表示 Devin(SWE-2 的使用者介面)提升了合併請求自動化的生產力。
  • 可用性 – 目前模型可透過 Cognition 的 Devin Desktop、CLI、Web 與 Fusion 平台取得;尚未宣布開放路由器或第三方 API 集成。

此次發布對程式碼代理生態的意義

  • 成本-效能主導地位 – SWE-2 展示了單一、多努力層級強化學習訓練的模型,可同時達成頂級解決率與顯著降低的每任務成本。
  • 方法論貢獻 – 帕累托導向的線性成本懲罰提供了一種有原則、可重現的訓練方法,適用於服務不同用戶預算的模型。
  • 更廣泛採用的潛力 – 若 Cognition 開放權重或提供具競爭力的 API 定價,SWE-2 可能成為 Fable 5.1 或 GPT‑6 Astra 等專有代理的可行替代方案。
  • 未解問題 – 社群仍對模型在所呈現基準之外的現實世界泛化能力,以及模型的開放程度存有疑問。

參考文獻

  1. Lu et al., FrontierCode 1.1, 2026 年 7 月。 https://cognition.com/blog/frontier-code-1.1
  2. Pan et al., SWE‑1.7: 以極低成本實現前沿智慧, 2026 年 7 月。 https://cognition.com/blog/swe-1-7
  3. Kimi Team, Kimi K3: 開放前沿智慧, arXiv:2607.24653, 2026 年 7 月。 https://arxiv.org/abs/2607.24653
  4. Kool et al., 買 4 個 REINFORCE 样本,免費獲得基準!, ICLR 2019 研討會。 https://openreview.net/pdf?id=r1lgTGL5DE
  5. Greensmith et al., 強化學習中梯度估計的變異數降低技術, JMLR 5, 2004。 https://jmlr.org/papers/volume5/greensmith04a/greensmith04a.pdf
  6. Hao et al., 具最佳獎勵基準的策略強化學習, arXiv:2505.23585, 2025 年 5 月。 https://arxiv.org/abs/2505.23585
  7. Cheng et al., DSpark: 信心調度的預測解碼, arXiv:2607.05147, 2026 年 7 月。 https://arxiv.org/abs/2607.05147
  8. Li et al., SpecForge: 預測解碼的高效訓練, arXiv:2603.18567, 2026 年 3 月。 https://arxiv.org/abs/2603.18567
  9. Cognition Team, 衡量開源衍生模型的可信度, 2026 年 7 月。 https://cognition.com/blog/measuring-open-source-model-trustworthiness

Sources

相關