Mistral AI Leanstral 發佈

Mistral AI 已發佈 Leanstral,這是一款專為 Lean 4 證明助手設計的開源程式碼代理(code agent)。Leanstral 旨在透過讓代理能夠針對嚴格的規範進行形式化證明實作,從而減少高風險軟體與數學研究中的人工審查瓶頸。

Leanstral 技術架構與存取方式

Leanstral 採用高效能模型,利用具有 6B 活性參數的稀疏架構。它針對證明工程任務進行了優化,並利用平行推論,並以 Lean 作為完美的驗證器,以維持成本效益與效能。

可用性與授權:

  • 授權: 以 Apache 2.0 授權條款發佈。
  • 整合: 可在 Mistral Vibe 中以代理模式使用(透過 /leanstallvibe --agent lean)。
  • API: 可透過 labs-leanstral-2603 免費/近乎免費的 API 端點存取。
  • 權重: 模型權重已提供用於本地部署。

Leanstral 透過 Vibe 支援任意的 Model Context Protocols (MCPs),並針對 lean-lsp-mcp 進行了特別優化。

FLTEval 效能基準測試

為了在現實的證明工程場景中評估模型,Mistral AI 推出了 FLTEval,這是一個全新的評估套件,用於基準測試在提交至 FLT 專案的 pull requests 中完成形式化證明以及定義新數學概念的能力。

與開源模型的比較

Leanstral-120B-A6B 展現出相對於較大型開源模型的顯著效率優勢。雖然 GLM5-744B-A40B 與 Kimi-K2.5-1T-32B 的 FLTEval 分數分別上限約為 16.6 與 20.1,但 Leanstral 在單次嘗試中便超越了兩者。

Qwen3.5-397B-A17B 需要四次嘗試才能達到 25.4 分,而 Leanstral 僅需兩次嘗試 (pass@2) 即可達到優於對方的 26.3 分,並在相同的成本水平下達到 29.3 分 (pass@4)。

與 Claude 系列的比較

Leanstral 提供了一個高價值的替代方案,可作為 Claude 系列的替代品,以較低的成本提供具競爭力的效能:

Model Cost ($) Score
Haiku 184 23.0
Sonnet 549 23.7
Opus 1,650 39.6
Leanstral 18 21.9
Leanstral pass@2 36 26.3
Leanstral pass@4 72 29.3
Leanstral pass@8 145 31.0
Leanstral pass@16 290 31.9

在 pass@2 時,Leanstral (分數 26.3) 以 36 美元的成本擊敗了 Sonnet (分數 23.7),而 Sonnet 的成本為 549 美元。在 pass@16 時,Leanstral 達到 31.9 分,比 Sonnet 高出 8 分。

實際能力與案例研究

Leanstral 能夠診斷複雜的編譯問題,並在證明助手之間轉換形式化定義。

偵錯 Lean 4 版本發佈

在一個涉及腳本在 Lean 4.29.0-rc6 中停止編譯的真實世界場景中,Leanstral 診斷出 rw (rewrite) 策略因 def 建立的型別別名而導致失敗。該模型使用測試程式碼重建了失敗的環境,並正確識別出 def 會建立一個僵化的定義,從而阻礙了 rw 策略。Leanstral 建議並實施了修復方案,將 def 替換為 abbrev,後者會建立一個透明的別名,從而允許 rw 策略成功匹配模式。

程式邏輯推理與轉換

Leanstral 成功地將定義從 Rocq 轉換為 Lean,包括自定義標記法 (notation) 的實作。它可以轉換 Rocq 陳述式,並隨後在 Lean 中證明其程式屬性,例如證明一個將變數 X 加上 2 的指令能正確地將狀態更新為 n+2。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch