Mistral AI Devstral 發佈

Mistral AI 與 All Hands AI 推出了 Devstral,這是一款專為軟體工程任務設計的代理型大型語言模型 (LLM)。Devstral 採用 Apache 2.0 授權,並透過與程式碼代理腳手架 (code agent scaffolds) 整合,優化了解決真實 GitHub 問題的能力。

在 SWE-Bench Verified 上展現高性能

Devstral 在 SWE-Bench Verified 基準測試中表現優於先前的開源最先進 (SoTA) 模型,該基準測試包含 500 個經人工篩選的真實 GitHub 問題。

關鍵性能指標包括:

  • 分數: Devstral 在 SWE-Bench Verified 上取得了 46.8% 的分數,比之前的開源 SoTA 模型高出超過 6 個百分點。
  • 與大型模型的比較: 當使用 OpenHands 測試腳手架進行評估時,Devstral 的表現優於規模大得多的模型,包括 Deepseek-V3-0324 (671B) 和 Qwen3 232B-A22B。
  • 與封閉模型之比較: Devstral 超越了數個封閉原始碼模型,包括 GPT-4.1-mini,漲幅超過 20%。

軟體工程的代理能力

與擅長單一原子化編碼任務(如獨立函數編寫或程式碼補全)的典型 LLM 不同,Devstral 旨在處理複雜的軟體工程問題。這包括:

  • 情境化: 在大型程式碼庫的上下文中理解程式碼的能力。
  • 關係映射: 識別系統中不同組件之間的連接。
  • 錯誤識別: 在複雜的函數中尋找細微的錯誤。

為了實現這些能力,Devstral 經過訓練以解決真實的 GitHub 問題,並透過 OpenHands 或 SWE-Agent 等代理腳手架運行,這些腳手架負責管理模型與測試案例之間的介面。

部署的靈活性與硬體需求

Devstral 旨在實現高效率,使其能夠部署在各種環境中:

  • 本地部署: 該模型足夠輕量,可以在單張 RTX 4090 GPU 或配備 32GB RAM 的 Mac 上運行,適合用於裝置端使用。
  • 企業級使用: 由於其性能和本地部署能力,對於受嚴格安全與合規性要求的隱私敏感型程式碼庫,它是進行代理式編碼的可靠選擇。
  • IDE 整合: Devstral 可以作為模型選擇選項,整合到代理式編碼 IDE、插件或環境中。

可用性與定價

Devstral 可透過多種管道供社群與企業使用:

  • 開源: 該模型在 Apache 2.0 授權下免費發佈,並可從 HuggingFace、Ollama、Kaggle、Unsloth 和 LM Studio 下載。
  • API 存取: 該模型可透過 Mistral AI 的 API 以 devstral-small-2505 提供。定價為每百萬輸入 token 0.1 美元,每百萬輸出 token 0.3 美元,與 Mistral Small 3.1 的定價一致。
  • 企業定制化: Mistral AI 透過其應用 AI 團隊提供私有程式碼庫的微調、持續預訓練以及蒸餾服務。

未來展望

Devstral 目前處於研究預覽階段。Mistral AI 已宣布,一個更大規模的代理式編碼模型正在開發中,預計將在未來幾週內推出。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch