您的 AI 有多過時?20 款當前模型的發布日期與訓練截止日期
TL;DR – 模型的新鮮度差異很大;許多頂級模型在訓練數據停止更新數月後才發布,且 8 家實驗室中僅有 5 家公開披露了截止日期。
該追蹤器衡量什麼
結論: 「Stale AI」頁面為每個模型列出了兩個時間戳——發布日期(模型公開可用的時間)和訓練截止日期(模型所訓練數據的最新日期)。兩者之間的差距量化了模型在發布時知識的過時程度。
- 該網站追蹤來自 8 家主要實驗室(Meta、Anthropic、Mistral AI、Google DeepMind、OpenAI、Alibaba、xAI、DeepSeek)的 20 款模型。
- 數據會自動刷新;計數器從每個日期開始向上累加。
- JSON 轉儲 (
models.json) 提供了用於程式設計的原始數據。
發布日期與訓練截止日期的差距
結論: 最大的差距超過五個月,這意味著使用者互動的模型缺乏半年前的資訊。
| 模型 | 實驗室 | 發布日期 | 訓練截止日期 | 差距(月) |
|---|---|---|---|---|
| Llama 4 | Meta | 2025年4月5日 | 2024年8月 | ~8 |
| Claude Haiku 4.5 | Anthropic | 2025年10月15日 | 2025年7月 | ~3 |
| Gemini 3.1 Pro | Google DeepMind | 2026年2月19日 | 2025年1月 | ~13 |
| Claude Sonnet 5 | Anthropic | 2026年6月30日 | 2026年1月 | ~5 |
| GPT-5.6 Sol / Luna | OpenAI | 2026年7月9日 | 2026年2月16日 | ~5 |
| Claude Opus 5 | Anthropic | 2026年7月24日 | 2026年5月 | ~2 |
| Grok 4.6 | xAI | 2026年8月12日 | 2026年2月1日 | ~6 |
| GPT-6 Astra | OpenAI | 2026年9月3日 | 2026年4月30日 | ~4 |
標記為「未確定」的模型沒有公開的截止日期,因此無法計算差距。
發布截止日期的實驗室
結論: 只有五家實驗室(Anthropic、Google DeepMind、Meta、OpenAI、xAI)至少提供了一個官方截止日期;其餘三家(Mistral AI、Alibaba、DeepSeek)則沒有。
- 20 款列出的模型中,有 10 款有披露截止日期。
- 空白條目並不證明該實驗室從未發布過日期;它僅表示作者無法找到該日期。
網路搜尋工具能縮小差距嗎?
結論: 不能。搜尋增強型回應僅針對當前查詢使用外部頁面,並不會更新模型的內部知識庫。
「當模型為您搜尋網路時,它並沒有學習任何東西。它閱讀了幾個頁面,將它們用於該次回答,然後就忘記了。開啟一個新的對話,時間又回到了四月。搜尋工具只是掩蓋了差距。它們永遠無法消除差距。」
因此,依賴瀏覽來彌補過時的訓練數據是一種暫時的修復,而非永久的解決方案。
來自 Hacker News 的社群觀察
結論: 從業人員在結合推理、工具使用和網路搜尋時,較少注意到數據過時的問題,但該問題在具體案例中仍然會浮現。
- gjskngnf 報告稱,在提示模型透過 Reuters 驗證一項聲明後,模型最終接受了該事實,這表明明確的來源檢查可以克服過時的知識。
- jasonjmcghee 附和說,良好的推理和工具使用減少了截止日期的影響。
- delichon 描述了一個現實世界的失敗案例:模型在 2024 年大選後數月仍將 Joe Biden 識別為總統,直到被迫瀏覽網路時才自行更正。
- VCFundedGenYer 強調,較舊的自託管模型(例如 Ollama 容器)仍然附帶 2023 年的截止日期,這對於許多應用程式來說是不可接受的。
- asimovDev 指出了一個具體錯誤,Qwen-3.8 生成了 2025 年的版權頁腳,並假設了過時的 Astro 框架版本。
這些軼事證實了過時的知識可能導致事實錯誤,特別是在政治、軟體版本和版權日期等對時間敏感的領域。
給開發者的實用建議
結論: 將模型知識視為一個快照,並始終使用外部來源驗證對時間敏感的事實。
- 詢問模型的截止日期 – 表現良好的模型會披露日期或承認不確定性。請對照追蹤器驗證答案。
- 針對任何關於近期事件、軟體發布或監管變更的查詢,使用明確的網路搜尋工具。
- 當新鮮度至關重要時,優先選擇有公開截止日期的模型;披露的日期為模型所知範圍提供了明確的界限。
- 監控模型發布 – 追蹤器會自動更新,因此您可以透過程式設計方式在有差距更小的新模型可用時提醒您的團隊。
為什麼新鮮度很重要
結論: 過時的知識可能導致錯誤資訊、法律風險和使用者信任度下降,特別是在 AI 成為主要資訊來源的情況下。
- 五個月的滯後意味著模型無法了解截止日期後發生的重大事件,例如選舉、政策變更或軟體發布。
- 在受監管的行業(金融、醫療保健)中,依賴過時數據可能導致合規違規。
- 使用者對最新答案的期望正在提高;一個反覆提供過時事實的模型將很快失去信譽。
透過追蹤發布日期和訓練截止日期,利害關係人可以就部署哪些模型、何時使用檢索工具進行補充以及何時規劃模型升級做出明智的選擇。
來源: 數據和解釋直接取自「How Stale Is Your AI?」追蹤器 (https://stale.jock.pl/) 以及相關的 Hacker News 討論 (https://news.ycombinator.com/item?id=49726343)。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch