Models.dev: AI 模型規格的開源標準

AI 領域正以驚人的速度演進,幾乎每週都有新模型發布。對於開發者和架構師而言,挑戰不僅在於尋找功能強大的模型,還在於追蹤數十個不同供應商破碎的規格、定價結構和功能。

Models.dev 由 SST 的維護者創建,旨在透過提供一個全面的、開源的 AI 模型規格資料庫來解決此問題。透過將這些數據集中在社群貢獻的格式中,它將手動研究任務轉變為可程式化的 API,讓開發者能夠構建可以動態適應當前 AI 市場現狀的工具。

核心架構:TOML 與 API

Models.dev 的核心不僅僅是一個網站,而是一個結構化的數據儲存庫。該專案使用按供應商和模型組織的 TOML 檔案來儲存關鍵的元數據(metadata)。這種方法確保了數據是版本控制的、易於人類閱讀,且社群可以透過 pull requests 輕鬆進行貢獻。

數據架構(Data Schema)

該資料庫追蹤廣泛的技術規格,超越了簡單的定價,還包括:

  • 功能(Capabilities): 支援檔案附件、推理/思維鏈(reasoning/chain-of-thought)、工具調用(tool calling)以及結構化輸出。
  • 限制(Limits): 最大上下文窗口(context windows),以及特定的輸入和輸出 token 限制。
  • 模態(Modalities): 對支援的輸入和輸出模態(例如:text, image, audio, video, PDF)進行清晰的定義。
  • 定價(Pricing): 細粒度的每百萬 token 成本追蹤,包括推理 token、快取讀取(cached reads)和快取寫入(cached writes)的獨立成本。
  • 元數據(Metadata): 知識截止日期、發布日期,以及模型是否為「open weights」。

可程式化存取

由於數據是結構化的,因此可以透過簡單的 JSON API (https://models.dev/api.json) 進行存取。這允許開發者使用與 AI SDK 一致的 Model ID 來執行查詢,並將模型規格直接整合到他們的應用程式中。

貢獻與驗證

為了在快速變動的市場中保持準確性,Models.dev 依賴於社群驅動的模型。該專案提供嚴格的架構(schema)和一個用於自動驗證的 GitHub Action。這確保了所有貢獻都遵循正確的數據類型和必填欄位,防止了經常困擾社群維基的「數據腐化」問題。

一個值得注意的功能是 extends 機制。對於鏡像其他供應商模型的包裝供應商(wrapper providers),貢獻者可以重複使用標準的模型定義,並僅覆蓋特定欄位。這減少了重複工作,並確保如果基礎模型的規格發生變化,更新會傳播到所有鏡像版本中。

社群觀點與缺口

雖然該專案被讚譽為「絕對的瑰寶」且具備速度與實用性,但 Hacker News 社群強調了未來成長的幾個領域:

對定性數據的需求

幾位用戶指出,原始規格並不能說明全部情況。一位貢獻者指出,「如果模型的品質隨著時間下降,或者供應商使用『自適應推理』將請求路由到更便宜、功能較弱的模型,那麼『每 token 成本』就毫無意義」。

每 token 成本毫無意義。例如,如果模型在任務進行到一半時變笨了,而你必須重新開始。如果模型經常這樣做,那麼成本會顯著高於標題數字。

社群強烈希望整合延遲基準測試(latency benchmarks)和真實世界的性能指標,以補充定價數據。

使用者體驗改進

從前端的角度來看,用戶要求更強大的過濾功能。雖然目前已有排序功能,但能夠過濾掉已關閉的模型或非 LLM 模型,被視為導航大型數據集的關鍵需求。

「標準」的挑戰

一些評論家指出,Models.dev 並非首次嘗試。LiteLLM、Artificial Analysis 和各種 GitHub 列表已經在追蹤模型定價。然而,Models.dev 專注於成為一個以開發者為中心、開源且能直接與 AI SDK 整合的資料庫,這表明其目標是成為一種 標準,而不僅僅是一個參考表。

結論

Models.dev 為 AI 時代提供了一個關鍵的基礎設施:一種標準化、機器可讀的方式來理解 AI 模型能做什麼以及成本是多少。雖然它在定性基準測試和 UI 過濾方面仍需演進,但其對開源和架構驗證方法的承諾,使其成為成為構建生產級 AI 應用程式的強大工具。

Sources