Laguna S 2.1 发布说明:高能力智能体编程模型
Laguna S 2.1 发布说明:高能力智能体编程模型
Laguna S 2.1 是一个总参数量为 118B 的混合专家 (MoE) 模型,专为长程智能体任务和复杂推理而设计。在每个 token 仅激活 8B 参数的情况下,它在编程基准测试中的表现足以与规模大其数倍的模型相媲美,这使其非常适合部署在本地机器和 NVIDIA DGX Spark 等专用工作站上。
性能基准测试与模型效率
Laguna S 2.1 通过在智能体编程任务中表现出远超其量级的效率,展示了极高的效率。在思考模式下,它在 Terminal-Bench 2.1 上获得了 70.2% 的分数,优于包括 DeepSeek-V4-Pro-Max (1.6T) 和 Inkling (975B) 在内的多个更大的开源权重模型。
对比基准测试结果
| Benchmark | Laguna S 2.1 (118B-A8B) | Tencent Hy3 (295B-A21B) | DeepSeek-V4-Pro Max (1.6T-A49B) | Kimi K3 (2.8T-A50B) | Claude Fable 5 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 70.2 | 71.7 | 64.0 | 88.3 | 88.0 |
| SWE-Bench Multilingual | 78.5 | 75.8 | 76.2 | - | - |
| SWE-Bench Pro (Public) | 59.4 | 57.9 | 55.4 | - | 80.3 |
| DeepSWE | 40.4 | - | 9.0 | 69.0 | 70.0 |
| SWE Atlas (Codebase QnA) | 46.2 | - | 27.2 | - | - |
| Toolathlon Verified | 49.7 | - | 55.9 | - | - |
在 DeepSWE v1.1 基准测试中——该测试的特点是包含更难部分解决的长程任务——Laguna S 2.1 在思考模式下获得了 40.4% 的分数。这一结果特别值得注意,因为它优于在同一基准测试中仅获得 9.0% 分数的 1.6T 参数的 DeepSeek-V4-Pro-Max。
核心能力与案例研究
Laguna S 2.1 的特点是持久性和资源利用能力,当直接方法失败时,它通常能找到实现目标的替代路径。
浏览器引擎构建
在一次长达 50 分钟、包含 181 个步骤且无需人工干预的会话中,该模型从一个空文件夹构建了一个可运行的 HTML/CSS 渲染引擎。为了克服其视觉能力的缺失,该模型使用 headless Chromium 实现了一个验证循环,通过读取 canvas 并将截图与真实浏览器进行数值对比来完成验证。
自动化测试框架优化
当被要求优化 Poolside 自己的智能体框架时,Laguna S 2.1 实现了 5.2% 的速度提升和约 70% 的内存分配减少。该模型识别出了 streaming-token 累积过程中的 $O(n^2)$ 字符串拼接问题,并将其替换为 buffers,同时还解决了轨迹物化 (trajectory materialization) 过程中的冗余拷贝问题。
数学发现
该模型独立地重新推导了 Erdős 问题 #397 的证明,该问题在 2026 年 1 月之前一直处于未解状态。由于模型的知识截止日期是 2025 年 11 月,因此这是一个全新的推导。该模型在其沙盒中使用 Perl 来进行暴力破解式的素因子分解和模式分析,从而找到了一个包含八个索引解的闭环形式无限族解。
技术架构与训练
Laguna S 2.1 是在不到九周的时间内开发的,它是通过使用相同的预训练数据从 Laguna XS 系列扩展而来的。
后训练与强化学习
大多数智能体能力源于两个阶段的后训练过程:使用合成数据进行 SFT 阶段,随后是针对困难任务的强化学习 (RL)。RL 是以 FP8 精度进行,以加速训练。训练语料库包括 409k 个环境,其中 168k 个针对软件工程工作流,83k 个针对终端使用场景。
思考模式与上下文
该模型支持高达 1M tokens 的上下文窗口,并具有两种思考模式:
- Off: 标准生成。
- Max (Default): 模型会确定最佳的测试时计算预算 (test-time compute budget)。
启用 "Max" 思考模式可以显著提升性能,将 Terminal-Bench 2.1 分数从 60.4% 提升至 70.2%,并将 DeepSWE 分数从 16.5% 提升至 40.4%。
已知局限性
- Harness Overfitting: 模型可能会偶尔依赖其对原生框架的工具接口记忆,而不是遵循第三方框架的特定 schema。
- Nested Tool Calls: 当工具参数需要 JSON 数组时,模型可能会在处理转义不当或无效的 JSON 时遇到困难。
- Overthinking: 在某些领域,如竞赛数学,模型可能会在取得进展之前生成过长的思考序列。
社区洞察与部署
社区反馈强调了该模型在家庭硬件上的可行性,以及它与 DeepSeek V4 Flash 等更大模型的竞争力。用户指出,确保启用 "thinking" 模式并增加 max_new_tokens(超过 generation_config.json 中的默认值 32k)对于实现所报道的质量是至关重要的。
Laguna S 2.1 已在 Hugging Face 上以 OpenMDW-1.1 许可证发布,提供 BF16, FP8, INT4, 和 NVFP4 权重。它支持 vLLM, SGLang, 和 Ollama 进行本地推理。