Cognition SWE-2 發布:效能、成本與訓練的創新
SWE-2 推動程式碼代理的帕累托前緣
Cognition 的新 SWE-2 模型在 FrontierCode 1.1 Main 基準上達到了 50.0% 的解決率——僅比領先的 Fable 5.1 少 1 分——同時運行成本降低了 64 %。此結果顯示,單一模型可在多個努力層級上同時主宰成本與效能的權衡曲線。
關鍵效能數字(數值越高越好,除非另有註明)
| 基準 | SWE‑2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT‑5.6 Sol | GPT‑6 Astra | SWE‑1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0 % | 44.2 % | 48.0 % | 50.9 % | 47.5 % | 53.3 % | 42.0 % |
| DeepSWE 1.1 | 73.0 % | 68.5 % | 67.5 % | 67.4 % | 72.7 % | 74.1 % | 37.7 % |
| Terminal‑Bench 2.1 | 92.8 % | 88.3 % | 88.4 % | 91.4 % | 88.8 % | 89.9 % | 81.5 % |
| Terminal‑Bench 4 | 27.3 % | 21.5 % | 20.3 % | 55.8 % | 37.3 % | 57.9 % | 7.6 % |
SWE‑2 在所有基準上均超越其前代 SWE‑1.7,且在得分與成本上皆擊敗 Grok 4.6。它以遠低於其價格的代價,與 GPT‑5.6 Sol 和 Fable 5/5.1 相匹敵,並在成本僅為 GPT‑6 Astra 四分之一的情況下,僅差幾分即可追平。
SWE-2 如何實現更高智慧與更低成本
1. 單一強化學習執行中的帕累托導向成本懲罰
- 線性成本懲罰 – 奖勵函數為
R = S – λₑ·C,其中S為二元成功,C為滾動成本,λₑ則根據基礎模型在努力層級e的成本-效能曲線的局部斜率進行調校。 - 為何選擇線性? – 一份證明(附錄 B)顯示,唯有仿射懲罰能確保期望獎勵僅依賴平均成本與解決率,而不受滾動分佈影響。
- 斜率匹配 – 將
λₑ設為前緣曲線的斜率,可使等獎勵線與帕累托曲線相切,確保獎勵提升同時也推動前緣向外延伸。
「讓 λₑ = m(局部斜率)可確保目標不受帕累托曲線上移動的影響,因此改進能直接向上推進前緣。」 – Cognition 博客
2. 長度加權獎勵基準
- 基準
b̂ = Σ Rᵢ·Lᵢ / Σ Lᵢ(以滾動長度加權的獎勵)在不需額外反向傳播的情況下,近似最佳的變異數降低基準。 - 實證消融實驗顯示,推論與訓練策略之間的 KL 散度顯著降低,穩定了強化學習。
3. 強化學習滾動服務與預測解碼
- DSpark 預測解碼 – 一個草稿模型提出詞元,由策略模型驗證,使吞吐量提升 10‑20 %。
- SpecForge 訓練的草稿模型 – 將接受的詞元長度延長約 15 %,並線上更新以追蹤演變中的策略。
- 低精度 MoE 推論 – 使用 NVFP4/FP8 核心與量化感知訓練,保持低記憶體使用量,同時維持 KL 對齊。
4. 資料規模與驗證器強化
- 將強化學習環境數量增加三倍,並擴展程式碼庫來源。
- 加入指令遵循覆蓋層,使模型在處理多個同時指令時仍能專注於任務。
- 實施遞迴飛輪機制:使用中間檢查點的滾動結果來發現並修補驗證器失敗,減少獎勵操弄。
SWE-2 觀察到的行為改進
- 專注的探索 – 中位數首次編輯發生在第 18 步(SWE‑1.7 為 48 步),探索開銷減少 62 %。
- 測試覆蓋率 – 產生更全面的端到端測試,更早發現回歸問題。
- 資源豐富性 – 當所需整合不存在時,SWE-2 可從現有上下文中重建所需資料(例如 Slack 歷史記錄)。
- 驗證紀律 – 當受到質疑時會重新推導結論,執行證據收集的實體,避免盲從同意。
- 努力層級差異化 – 中等 努力層級在簡單/中等任務上表現出色且成本低;高 與 最大 努力層級則為複雜問題分配更多規劃與驗證。
可信度評估
Cognition 對六個模型(包含 SWE-2)重新執行了內部的宣傳/審查與情境依賴性漏洞測試。結果如下:
- 宣傳與審查 – SWE-2 整體通過率為 98.0 %(英文 99.8 %,簡體中文 95.2 %,繁體中文 99.1 %)。
- 情境依賴性漏洞 – 無模型出現統計上顯著的框架效應;SWE-2 的平均漏洞偏移接近零,與同儕相符。
Hacker News 社群反應
- 對基準泛化性的懷疑 – 一則高分評論指出,Terminal‑Bench 2.1(92.8 %)與 Terminal‑Bench 4(27.3 %)之間的巨大差距,顯示可能存在「基準最大化」現象。
- 對 K3 後訓練的擔憂 – 部分使用者質疑改進是否僅源自強大的 K3 基底,而非新穎的工程設計。
- 開放權重 vs. 封閉權重的辯論 – 多位評論者詢問 SWE-2 是否會以開放權重形式發布,並與 DeepSeek Flash 4.1 等模型比較。
- 產品體驗 – 反響不一:部分使用者認為先前的 SWE‑1.7 不可用,而其他人則表示 Devin(SWE-2 的使用者介面)提升了合併請求自動化的生產力。
- 可用性 – 目前模型可透過 Cognition 的 Devin Desktop、CLI、Web 與 Fusion 平台取得;尚未宣布開放路由器或第三方 API 集成。
此次發布對程式碼代理生態的意義
- 成本-效能主導地位 – SWE-2 展示了單一、多努力層級強化學習訓練的模型,可同時達成頂級解決率與顯著降低的每任務成本。
- 方法論貢獻 – 帕累托導向的線性成本懲罰提供了一種有原則、可重現的訓練方法,適用於服務不同用戶預算的模型。
- 更廣泛採用的潛力 – 若 Cognition 開放權重或提供具競爭力的 API 定價,SWE-2 可能成為 Fable 5.1 或 GPT‑6 Astra 等專有代理的可行替代方案。
- 未解問題 – 社群仍對模型在所呈現基準之外的現實世界泛化能力,以及模型的開放程度存有疑問。
參考文獻
- Lu et al., FrontierCode 1.1, 2026 年 7 月。 https://cognition.com/blog/frontier-code-1.1
- Pan et al., SWE‑1.7: 以極低成本實現前沿智慧, 2026 年 7 月。 https://cognition.com/blog/swe-1-7
- Kimi Team, Kimi K3: 開放前沿智慧, arXiv:2607.24653, 2026 年 7 月。 https://arxiv.org/abs/2607.24653
- Kool et al., 買 4 個 REINFORCE 样本,免費獲得基準!, ICLR 2019 研討會。 https://openreview.net/pdf?id=r1lgTGL5DE
- Greensmith et al., 強化學習中梯度估計的變異數降低技術, JMLR 5, 2004。 https://jmlr.org/papers/volume5/greensmith04a/greensmith04a.pdf
- Hao et al., 具最佳獎勵基準的策略強化學習, arXiv:2505.23585, 2025 年 5 月。 https://arxiv.org/abs/2505.23585
- Cheng et al., DSpark: 信心調度的預測解碼, arXiv:2607.05147, 2026 年 7 月。 https://arxiv.org/abs/2607.05147
- Li et al., SpecForge: 預測解碼的高效訓練, arXiv:2603.18567, 2026 年 3 月。 https://arxiv.org/abs/2603.18567
- Cognition Team, 衡量開源衍生模型的可信度, 2026 年 7 月。 https://cognition.com/blog/measuring-open-source-model-trustworthiness
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch