Laguna S 2.1 發佈說明:高能力代理編碼模型
Laguna S 2.1 發佈說明:高能力代理編碼模型
Laguna S 2.1 是一款總參數為 118B 的混合專家模型 (MoE),專為長程代理任務與複雜推理而設計。在每個 token 僅需 8B 激活參數的情況下,它在編碼基準測試中的表現足以與規模大其數倍的模型競爭,使其非常適合部署在本地機器和如 NVIDIA DGX Spark 等專業工作站上。
性能基準測試與模型效率
Laguna S 2.1 在代理編碼任務中展現了極高的效率,表現遠超其參數規模。在思考模式下,它在 Terminal-Bench 2.1 獲得了 70.2% 的分數,超越了包括 DeepSeek-V4-Pro-Max (1.6T) 和 Inkling (975B) 在內的多個較大的開源權重模型。
比較基準測試結果
| 基準測試 | Laguna S 2.1 (118B-A8B) | Tencent Hy3 (295B-A21B) | DeepSeek-V4-Pro Max (1.6T-A49B) | Kimi K3 (2.8T-A50B) | Claude Fable 5 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 70.2 | 71.7 | 64.0 | 88.3 | 88.0 |
| SWE-Bench Multilingual | 78.5 | 75.8 | 76.2 | - | - |
| SWE-Bench Pro (Public) | 59.4 | 57.9 | 55.4 | - | 80.3 |
| DeepSWE | 40.4 | - | 9.0 | 69.0 | 70.0 |
| SWE Atlas (Codebase QnA) | 46.2 | - | 27.2 | - | - |
| Toolathlon Verified | 49.7 | - | 55.9 | - | - |
在 DeepSWE v1.1 基準測試中——該測試的特點是具有更難以部分解決的長程任務——Laguna S 2.1 在思考模式下獲得了 40.4% 的分數。這一結果特別值得注意,因為它超越了在同一基準測試中獲得 9.0% 分數的 1.6T 參數 DeepSeek-V4-Pro-Max。
核心能力與案例研究
Laguna S 2.1 的特點在於其持久性與應變能力,當直接方法失敗時,它經常能找到達成目標的替代路徑。
瀏覽器引擎構建
在一個沒有人類干預的 50 分鐘、181 步會話中,該模型從一個空白資料夾構建了一個可運行的 HTML/CSS 渲染引擎。為了克服其缺乏視覺能力的缺點,模型實施了使用 headless Chromium 的驗證迴圈,以讀取 canvas 並將截圖與真實瀏覽器進行數值化對比。
自動化測試框架優化
當被要求優化 Poolside 自己的代理框架時,Laguna S 2.1 實現了 5.2% 的加速與約 70% 的記憶體分配減少。該模型識別出在串流 token 累積過程中存在的 $O(n^2)$ 字串拼接問題,並將其替換為 buffer,同時也解決了在軌跡物化化過程中產生的冗餘複製問題。
數學發現
該模型獨立地重新推導了 Erdős 問題 #397 的證明,這是一個直到 2026 年 1 月才得以解決的懸而未決的問題。由於模型的知識截止日期為 2025 年 11 月,這是一個全新的推導。模型在沙盒中使用 Perl 來進行暴力破解的質因數分解與模式分析,以尋找八個索引解的閉式無限族解法。
技術架構與訓練
Laguna S 2.1 是在不到九週內開發完成的,它是從 Laguna XS 系列擴展而來的,並使用相同的預訓練數據。
訓練後處理與強化學習 (RL)
模型的大部分代理能力源於兩個階段的訓練後處理過程:一個使用合成數據的 SFT 階段,隨後是針對困難任務的強化學習 (RL)。RL 是以 FP8 精度進行的,以加速訓練。訓練語料庫包括 409k 個環境,其中 168k 個針對軟體工程工作流,83k 個針對終端機使用案例。
思考模式與上下文
該模型支持最高 1M token 的上下文窗口,並具有兩種思考模式:
- Off: 標準生成。
- Max (Default): 模型會決定最佳的測試時計算預算。
啟用 "Max" 思考模式可以顯著提升性能,將 Terminal-Bench 2.1 分數從 60.4% 提升至 70.2%,並將 DeepSWE 分數從 16.5% 提升至 40.4%。
已知限制
- Harness Overfitting: 模型可能會偶於依賴其原生框架的工具介面記憶,而非遵循第三方框架的特定 schema。
- Nested Tool Calls: 當工具參數需要 JSON 陣列時,模型可能會在處理轉義不當或無效的 JSON 時遇到困難。
- Overthinking: 在某些領域,例如競賽數學,模型可能會在取得進展前生成過於冗長的思考序列。
社群群眾意見與部署
社群回饋強調了該模型在家庭硬體上的可行性,以及其與 DeepSeek V4 Flash 等較大模型的競爭力。使用者注意到,確保啟用 "thinking" 並增加 max_new_tokens (超出 generation_config.json 中的預設值 32k) 對於達到報告的代碼品質是至關重要的。
Laguna S 2.1 已在 Hugging Face 上以 OpenMDW-1.1 授權提供,包含 BF16, FP8, INT4, 和 NVFP4 權重。它支援 vLLM, SGLang, 和 Ollama 進行本地推理。