Mistral AI Leanstral 发布

Mistral AI 发布了 Leanstral,这是一个专为 Lean 4 证明助手设计的开源代码智能体。Leanstral 旨在通过使智能体能够针对严格的规范进行形式化证明实现,从而减少高风险软件和数学研究中的人工审查瓶颈。

Leanstral 技术架构与访问方式

Leanstral 是一个高效的模型,采用了具有 6B 激活参数的稀疏架构。它针对证明工程任务进行了优化,并利用并行推理,同时让 Lean 充当完美的验证器,以保持成本效益和性能。

可用性与许可:

  • 许可: 根据 Apache 2.0 许可发布。
  • 集成: 可在 Mistral Vibe 中以智能体模式使用(通过 /leanstallvibe --agent lean)。
  • API: 可通过 labs-leanstral-2603 免费/近乎免费的 API 端点访问。
  • 权重: 模型权重可用于本地部署。

Leanstral 通过 Vibe 支持任意的模型上下文协议 (MCPs),并专门针对 lean-lsp-mcp 进行了优化。

FLTEval 性能基准测试

为了在真实的证明工程场景中评估模型,Mistral AI 推出了 FLTEval,这是一个全新的评估套件,用于基准测试在向 FLT 项目提交 pull requests 时完成形式化证明和定义新数学概念的能力。

与开源模型的比较

Leanstral-120B-A6B 在效率方面表现出相对于大型开源模型的显著优势。虽然 GLM5-744B-A40B 和 Kimi-K2.5-1T-32B 的 FLTEval 分数分别封顶在约 16.6 和 20.1,但 Leanstral 在单次尝试中就超过了两者。

Qwen3.5-397B-A17B 需要四次尝试才能达到 25.4 分,而 Leanstral 仅需两次尝试 (pass@2) 即可达到优于其它的 26.3 分,并在相同的成本水平下达到 29.3 分 (pass@4)。

与 Claude 系列的比较

Leanstral 为 Claude 系列提供了一个高价值的替代方案,以较低的成本提供具有竞争力的性能:

Model Cost ($) Score
Haiku 184 23.0
Sonnet 549 23.7
Opus 1,650 39.6
Leanstral 18 21.9
Leanstral pass@2 36 26.3
Leanstral pass@4 72 29.3
Leanstral pass@8 145 31.0
Leanstral pass@16 290 31.9

在 pass@2 时,Leanstral (分数 26.3) 以 36 美元的成本击败了 Sonnet (分数 23.7),而 Sonnet 的成本为 549 美元。在 pass@16 时,Leanstral 的分数达到 31.9,超过了 Sonnet 8 分。

实际能力与案例研究

Leanstral 能够诊断复杂的编译问题并在证明助手之间翻译形式化定义。

调试 Lean 4 版本发布

在涉及一个在 Lean 4.29.0-rc6 中停止编译的脚本的真实场景中,Leanstral 诊断出 rw (rewrite) 策略由于使用 def 创建的类型别名而导致失败。该模型使用测试代码重建了失败的环境,并正确识别出 def 会创建一个刚性的定义,从而阻碍了 rw 策略。Leanstral 提出并实现了一个修复方案,将 def 替换为 abbrev,后者会创建一个透明的别名,从而允许 rw 策略成功匹配模式。

程序推理与翻译

Leanstral 成功地将定义从 Rocq 转换为 Lean,包括自定义符号的使用实现。它可以翻译 Rocq 语句并随后在 Lean 中证明关于这些程序的属性,例如证明一个将变量 X 增加 2 的命令可以正确地将状态更新为 n+2。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch