Codestral Embed 模型發布

TL;DR

Mistral AI 宣布推出其首款專為原始碼設計的嵌入模型 Codestral Embed,並展示該模型在真實世界原始碼檢索基準測試中超越了主要競爭對手(Voyage Code 3、Cohere Embed v4.0、OpenAI 的大型嵌入模型)。

模型概覽

Codestral Embed 是為高效率原始碼檢索與語義理解而設計的模型。該模型可產生多種維度(例如 256)與數值精度(包括 int8)的嵌入向量。Mistral 表示,即使是最小的配置(256 維 int8)也超越了他們評估過的所有競爭模型。嵌入向量的維度依相關性排序,讓使用者可截斷至任意整數 n,從而獲得檢索品質與儲存成本之間的平滑權衡。

檢索品質與儲存成本的權衡圖:Codestral Embed

基準測試表現

Codestral Embed 在多項以原始碼為核心的檢索任務中進行了基準測試。結果按類別總結,Mistral 提供了詳細的基準測試表格。

類別 代表性基準測試
檢索增強生成 SWE‑Bench lite(真實 GitHub 問題 → 相關檔案)
語義原始碼搜尋 CodeSearchNet(原始碼→原始碼,doc2code)
相似性與重複檢測 CommitPack(提交訊息 → 修改的檔案)
文字轉 SQL Spider、WikiSQL、合成文字轉 SQL
演算法原始碼匹配 DM 程式競賽、APPS、CodeChef、MBPP+
資料科學原始碼匹配 DS 1000

Mistral 指出,該模型在每一類別中均取得最高平均分數,並在所有類別的宏平均分數上領先。

主要應用場景

1. 檢索增強生成(RAG)

Codestral Embed 可實現快速的上下文檢索,適用於原始碼補全、編輯或解釋,非常適合用於 AI 駕駛的副駕駛工具與程式碼代理框架。

2. 語義原始碼搜尋

嵌入向量支援從自然語言或原始碼查詢中準確搜尋原始碼片段,適合整合至開發者工具、文件系統與副駕駛工具中。

3. 相似性搜尋與重複檢測

即使在詞法差異下仍能捕捉功能上的相似性,該模型有助於識別可重複使用的程式碼、避免重複實作,並確保授權政策的執行。

4. 語義聚類與程式碼分析

可實現無監督的程式碼功能或結構分組,有助於程式碼庫組成分析、架構發現與自動化文件生成。

可用性與定價

  • API 名稱: codestral-embed-2505
  • 成本: 每百萬 token 僅需 $0.15(標準 API)——批次 API 可享 50 % 折扣。
  • 本地部署: 可透過直接聯繫 Mistral 的應用 AI 團隊取得。

提供文件、快速入門指南與 Colab 烹飪書:

推薦的分塊策略

針對檢索場景,Mistral 建議將原始碼檔案切分成 約 3000 字元的區段,並保留 1000 字元的重疊。雖然模型可處理最多 8192 個 token,但過大的區段會降低檢索表現。

基準測試細節

Mistral 列出用於評估 Codestral Embed 的具體基準測試:

基準測試 描述 類別
SWE‑Bench lite 檢索檔案以修復真實的 GitHub 問題 swebench_lite
CodeSearchNet(原始碼→原始碼) 檢索出在同一上下文中出現的原始碼 code2code
CodeSearchNet doc2code 根據文件字串查詢檢索原始碼 Text2code (github)
CommitPack 根據提交訊息檢索修改的檔案 Text2code (github)
Spider 根據自然語言查詢檢索 SQL 原始碼 Text2SQL
WikiSQL 根據自然語言查詢檢索 SQL 原始碼 Text2SQL
Synthetic Text2SQL 根據合成查詢檢索 SQL 原始碼 Text2SQL
DM 程式競賽 將問題描述與正確的競賽解答匹配 Text2Code (演算法)
APPS 將問題描述與競賽解答匹配 Text2Code (演算法)
CodeChef 將問題描述與競賽解答匹配 Text2Code (演算法)
MBPP+ 將演算法問題與 Python 解答匹配 Text2Code (演算法)
DS 1000 將資料科學問題與實作匹配 Text2Code (資料科學)

這些基準測試涵蓋了廣泛的原始碼檢索任務,證實了該模型在軟體工程、資料科學與演算法領域的多功能性。


  • 所有陳述皆直接來自 Mistral AI 於 2025‑05‑28 發布的官方公告。*

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch