Mistral AI Leanstral 發佈
Mistral AI 已發佈 Leanstral,這是一款專為 Lean 4 證明助手設計的開源程式碼代理(code agent)。Leanstral 旨在透過讓代理能夠針對嚴格的規範進行形式化證明實作,從而減少高風險軟體與數學研究中的人工審查瓶頸。
Leanstral 技術架構與存取方式
Leanstral 採用高效能模型,利用具有 6B 活性參數的稀疏架構。它針對證明工程任務進行了優化,並利用平行推論,並以 Lean 作為完美的驗證器,以維持成本效益與效能。
可用性與授權:
- 授權: 以 Apache 2.0 授權條款發佈。
- 整合: 可在 Mistral Vibe 中以代理模式使用(透過
/leanstall或vibe --agent lean)。 - API: 可透過
labs-leanstral-2603免費/近乎免費的 API 端點存取。 - 權重: 模型權重已提供用於本地部署。
Leanstral 透過 Vibe 支援任意的 Model Context Protocols (MCPs),並針對 lean-lsp-mcp 進行了特別優化。
FLTEval 效能基準測試
為了在現實的證明工程場景中評估模型,Mistral AI 推出了 FLTEval,這是一個全新的評估套件,用於基準測試在提交至 FLT 專案的 pull requests 中完成形式化證明以及定義新數學概念的能力。
與開源模型的比較
Leanstral-120B-A6B 展現出相對於較大型開源模型的顯著效率優勢。雖然 GLM5-744B-A40B 與 Kimi-K2.5-1T-32B 的 FLTEval 分數分別上限約為 16.6 與 20.1,但 Leanstral 在單次嘗試中便超越了兩者。
Qwen3.5-397B-A17B 需要四次嘗試才能達到 25.4 分,而 Leanstral 僅需兩次嘗試 (pass@2) 即可達到優於對方的 26.3 分,並在相同的成本水平下達到 29.3 分 (pass@4)。
與 Claude 系列的比較
Leanstral 提供了一個高價值的替代方案,可作為 Claude 系列的替代品,以較低的成本提供具競爭力的效能:
| Model | Cost ($) | Score |
|---|---|---|
| Haiku | 184 | 23.0 |
| Sonnet | 549 | 23.7 |
| Opus | 1,650 | 39.6 |
| Leanstral | 18 | 21.9 |
| Leanstral pass@2 | 36 | 26.3 |
| Leanstral pass@4 | 72 | 29.3 |
| Leanstral pass@8 | 145 | 31.0 |
| Leanstral pass@16 | 290 | 31.9 |
在 pass@2 時,Leanstral (分數 26.3) 以 36 美元的成本擊敗了 Sonnet (分數 23.7),而 Sonnet 的成本為 549 美元。在 pass@16 時,Leanstral 達到 31.9 分,比 Sonnet 高出 8 分。
實際能力與案例研究
Leanstral 能夠診斷複雜的編譯問題,並在證明助手之間轉換形式化定義。
偵錯 Lean 4 版本發佈
在一個涉及腳本在 Lean 4.29.0-rc6 中停止編譯的真實世界場景中,Leanstral 診斷出 rw (rewrite) 策略因 def 建立的型別別名而導致失敗。該模型使用測試程式碼重建了失敗的環境,並正確識別出 def 會建立一個僵化的定義,從而阻礙了 rw 策略。Leanstral 建議並實施了修復方案,將 def 替換為 abbrev,後者會建立一個透明的別名,從而允許 rw 策略成功匹配模式。
程式邏輯推理與轉換
Leanstral 成功地將定義從 Rocq 轉換為 Lean,包括自定義標記法 (notation) 的實作。它可以轉換 Rocq 陳述式,並隨後在 Lean 中證明其程式屬性,例如證明一個將變數 X 加上 2 的指令能正確地將狀態更新為 n+2。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch