Models.dev: AI 模型規格的開源標準
AI 領域正以驚人的速度演進,幾乎每週都有新模型發布。對於開發者和架構師而言,挑戰不僅在於尋找功能強大的模型,還在於追蹤數十個不同供應商破碎的規格、定價結構和功能。
Models.dev 由 SST 的維護者創建,旨在透過提供一個全面的、開源的 AI 模型規格資料庫來解決此問題。透過將這些數據集中在社群貢獻的格式中,它將手動研究任務轉變為可程式化的 API,讓開發者能夠構建可以動態適應當前 AI 市場現狀的工具。
核心架構:TOML 與 API
Models.dev 的核心不僅僅是一個網站,而是一個結構化的數據儲存庫。該專案使用按供應商和模型組織的 TOML 檔案來儲存關鍵的元數據(metadata)。這種方法確保了數據是版本控制的、易於人類閱讀,且社群可以透過 pull requests 輕鬆進行貢獻。
數據架構(Data Schema)
該資料庫追蹤廣泛的技術規格,超越了簡單的定價,還包括:
- 功能(Capabilities): 支援檔案附件、推理/思維鏈(reasoning/chain-of-thought)、工具調用(tool calling)以及結構化輸出。
- 限制(Limits): 最大上下文窗口(context windows),以及特定的輸入和輸出 token 限制。
- 模態(Modalities): 對支援的輸入和輸出模態(例如:text, image, audio, video, PDF)進行清晰的定義。
- 定價(Pricing): 細粒度的每百萬 token 成本追蹤,包括推理 token、快取讀取(cached reads)和快取寫入(cached writes)的獨立成本。
- 元數據(Metadata): 知識截止日期、發布日期,以及模型是否為「open weights」。
可程式化存取
由於數據是結構化的,因此可以透過簡單的 JSON API (https://models.dev/api.json) 進行存取。這允許開發者使用與 AI SDK 一致的 Model ID 來執行查詢,並將模型規格直接整合到他們的應用程式中。
貢獻與驗證
為了在快速變動的市場中保持準確性,Models.dev 依賴於社群驅動的模型。該專案提供嚴格的架構(schema)和一個用於自動驗證的 GitHub Action。這確保了所有貢獻都遵循正確的數據類型和必填欄位,防止了經常困擾社群維基的「數據腐化」問題。
一個值得注意的功能是 extends 機制。對於鏡像其他供應商模型的包裝供應商(wrapper providers),貢獻者可以重複使用標準的模型定義,並僅覆蓋特定欄位。這減少了重複工作,並確保如果基礎模型的規格發生變化,更新會傳播到所有鏡像版本中。
社群觀點與缺口
雖然該專案被讚譽為「絕對的瑰寶」且具備速度與實用性,但 Hacker News 社群強調了未來成長的幾個領域:
對定性數據的需求
幾位用戶指出,原始規格並不能說明全部情況。一位貢獻者指出,「如果模型的品質隨著時間下降,或者供應商使用『自適應推理』將請求路由到更便宜、功能較弱的模型,那麼『每 token 成本』就毫無意義」。
每 token 成本毫無意義。例如,如果模型在任務進行到一半時變笨了,而你必須重新開始。如果模型經常這樣做,那麼成本會顯著高於標題數字。
社群強烈希望整合延遲基準測試(latency benchmarks)和真實世界的性能指標,以補充定價數據。
使用者體驗改進
從前端的角度來看,用戶要求更強大的過濾功能。雖然目前已有排序功能,但能夠過濾掉已關閉的模型或非 LLM 模型,被視為導航大型數據集的關鍵需求。
「標準」的挑戰
一些評論家指出,Models.dev 並非首次嘗試。LiteLLM、Artificial Analysis 和各種 GitHub 列表已經在追蹤模型定價。然而,Models.dev 專注於成為一個以開發者為中心、開源且能直接與 AI SDK 整合的資料庫,這表明其目標是成為一種 標準,而不僅僅是一個參考表。
結論
Models.dev 為 AI 時代提供了一個關鍵的基礎設施:一種標準化、機器可讀的方式來理解 AI 模型能做什麼以及成本是多少。雖然它在定性基準測試和 UI 過濾方面仍需演進,但其對開源和架構驗證方法的承諾,使其成為成為構建生產級 AI 應用程式的強大工具。