探測前沿 AI 模型之知識截止日期與訓練時間線
前沿 AI 模型可以透過精心設計的請求進行探測,以揭示其訓練時間線、數據集混合比例以及參數近似值的隱藏事實。藉由分析每日事實的錯誤率與自我認同回應,研究人員可以估計模型的預訓練檢查點(pre-training checkpoint)何時完成,以及該模型是否使用了前代模型的輸出進行訓練。
透過事實探測估計知識截止日期
知識截止日期可以透過在維基百科的每日事實數據集上測試模型,並分析模型錯誤率上升的時間點來進行近似估計。這種方法揭示了模型的實質事實知識與其發布的知識截止日期之間的差距。
模型截止日期的關鍵發現
- Anthropic Opus 4.7+: 這些模型似乎源自同一次訓練運行,其有效的知識截止日期約在 2025 年 12 月下旬。
- OpenAI GPT-5.6 系列: 此系列可能來自一個與 GPT-5.5 分離的獨立檢查點,完成日期約在 2026 年 年 2 月下旬。
- Opus 5 差異: 雖然 Opus 5 已發布可靠的 2026 年 5 月知識截止日期,但探測結果顯示其所知內容與 2026 年 1 月截止日期的模型相差無幾,包括對程式碼套件版本的召回能力。
前沿模型訓練的三個階段
現代大型語言模型(LLM)的開發通常遵循三個階段的收斂過程:
- 預訓練 (Pre-training): 在海量的通用網路數據抓取內容上訓練一個巨大的自動補全模型,以建立基礎檢查點。
- 能力增強 (Capability Enhancement): 使用特定領域的「教科書品質」數據來提升基礎能力,例如長文本理解。
- 後訓練 (Post-training): 將模型微調為助手人格,專注於推理、個性與工具調用(tool-calling)。
已發布模型的次要版本(minor versions)通常源於後訓練與能力的進步,而主要版本(major versions,例如從 GPT-4 到 GPT-5)通常意味著進行了新的預訓練運行。
分析模型身份與訓練混合比例
藉由在沒有系統提示詞(system prompts)的情況下,使用「你是哪種模型?」等問題探測模型,研究人員可以推斷訓練數據的組成。當模型頻繁地將自己識別為特定版本或來自不同實驗室的模型時,這顯示訓練混合比例中包含了大量來自該來源的數據。
使用用戶聊天記錄進行訓練的證據
探測結果顯示出垂直的身份帶狀分佈,這顯示實驗室正在使用前代模型的輸出進行訓練。對於 OpenAI,模型曾識別為 GPT-4、GPT-4o 與 GPT-5。Anthropic 模型則從識別為 3.5 Sonnet 轉變為 Sonnet 4.5。這種模式強烈暗示了使用來自 ChatGPT.com 與 Claude.ai 等平台的用戶聊天對話作為訓練材料。
實驗室間的數據污染
數據顯示實驗室之間可能存在資訊流動。具體而言,Anthropic 的 Sonnet 5 會定期自我識別為 GPT-4。此外,當被要求模仿其他模型時,Claude 模型以 68% 的成功率複製了 OpenAI 的特性,而 OpenAI 模型複製 Claude 特性的成功率僅為 8%。
社群洞察與反論點
關於這些發現的技術討論強調了 LLM 在儲存與報告知識時的幾種細微差別:
"I suspect that LLMs have distinct/partitioned cutoff dates; for example, historical literature doesn't change... general knowledge (updated only in certain areas), technologies (updated regularly)... and tabloid knowledge, which is always up-to-date."
其他貢獻者指出,「Opus 5」等行銷名稱可能並不代表單一靜態模型,而是版本與次要更新的集合,且在初始預訓練知識截止日期之後,還會進行多個週期的安全與對齊訓練。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch