你的 AI 有多过时?20 款主流模型的发布日期与训练截止日期
TL;DR – 模型的新鲜度差异巨大;许多顶级模型在训练数据截止数月后才发布,且 8 家实验室中仅有 5 家公开披露了截止日期。
该追踪器衡量的内容
结论: “Stale AI”页面为每个模型列出了两个时间戳——发布日期(模型公开可用的时间)和训练截止日期(模型所训练数据的最新日期)。两者之间的差距量化了模型在发布时知识的过时程度。
- 该网站追踪了来自 8 家主要实验室(Meta、Anthropic、Mistral AI、Google DeepMind、OpenAI、Alibaba、xAI、DeepSeek)的 20 款模型。
- 数据会自动刷新;计数器会从每个日期开始向上累加。
- 一个 JSON 转储文件 (
models.json) 提供了用于程序化调用的原始数据。
发布日期与训练截止日期的差距
结论: 最大的差距超过五个月,这意味着用户正在与缺乏半年旧信息的模型进行交互。
| 模型 | 实验室 | 发布日期 | 训练截止日期 | 差距(月) |
|---|---|---|---|---|
| Llama 4 | Meta | 2025年4月5日 | 2024年8月 | ~8 |
| Claude Haiku 4.5 | Anthropic | 2025年10月15日 | 2025年7月 | ~3 |
| Gemini 3.1 Pro | Google DeepMind | 2026年2月19日 | 2025年1月 | ~13 |
| Claude Sonnet 5 | Anthropic | 2026年6月30日 | 2026年1月 | ~5 |
| GPT-5.6 Sol / Luna | OpenAI | 2026年7月9日 | 2026年2月16日 | ~5 |
| Claude Opus 5 | Anthropic | 2026年7月24日 | 2026年5月 | ~2 |
| Grok 4.6 | xAI | 2026年8月12日 | 2026年2月1日 | ~6 |
| GPT-6 Astra | OpenAI | 2026年9月3日 | 2026年4月30日 | ~4 |
标记为“未确定”的模型没有公布截止日期,因此无法计算差距。
发布截止日期的实验室
结论: 只有五家实验室(Anthropic、Google DeepMind、Meta、OpenAI、xAI)提供了至少一个官方截止日期;其余三家(Mistral AI、Alibaba、DeepSeek)则没有。
- 在列出的 20 款模型中,有 10 款披露了截止日期。
- 空白条目并不证明该实验室从未发布过日期;它仅表示作者未能找到相关信息。
网络搜索工具能弥补差距吗?
结论: 不能。搜索增强型响应仅将外部页面用于当前查询,并不会更新模型的内部知识库。
“当模型为你搜索网络时,它并没有学习任何东西。它阅读了几页内容,在那个回答中使用它们,然后就忘记了。打开一个新的聊天窗口,时间又回到了四月。搜索工具只是掩盖了差距,它们从未真正消除差距。”
因此,依赖浏览功能来弥补过时的训练数据是一种临时修复,而非永久解决方案。
来自 Hacker News 的社区观察
结论: 从业者在结合推理、工具使用和网络搜索时,较少注意到数据过时的问题,但该问题在具体案例中依然会出现。
- gjskngnf 报告称,在提示模型通过 Reuters 验证某项声明后,模型最终接受了事实,这表明显式的来源检查可以克服过时的知识。
- jasonjmcghee 附和道,良好的推理和工具使用减少了截止日期的影响。
- delichon 描述了一个现实中的失败案例:模型在 2024 年大选后数月仍将 Joe Biden 识别为总统,直到被迫浏览网页时才自行纠正。
- VCFundedGenYer 强调,较旧的自托管模型(例如 Ollama 容器)仍然带有 2023 年的截止日期,这对许多应用来说是不可接受的。
- asimovDev 指出了一个具体错误,Qwen-3.8 生成了 2025 年的版权页脚,并假设了 Astro 框架的过时版本。
这些轶事证实,过时的知识可能导致事实错误,特别是在政治、软件版本和版权日期等对时间敏感的领域。
给开发者的实用建议
结论: 将模型知识视为一个快照,并始终使用外部来源验证对时间敏感的事实。
- 询问模型的截止日期 – 表现良好的模型要么会披露日期,要么会承认不确定性。请根据追踪器核实答案。
- 对任何关于近期事件、软件发布或监管变更的查询使用显式网络搜索工具。
- 在新鲜度至关重要时,优先选择有公布截止日期的模型;披露的日期为模型所知的内容提供了明确的界限。
- 监控模型发布 – 追踪器会自动更新,因此你可以通过编程方式在有更新、差距更小的模型可用时提醒你的团队。
为什么新鲜度很重要
结论: 过时的知识可能导致错误信息、法律风险和用户信任度下降,尤其是在 AI 成为主要信息来源的情况下。
- 五个月的滞后意味着模型无法了解截止日期之后发生的重大事件,如选举、政策变化或软件发布。
- 在受监管的行业(金融、医疗保健)中,依赖过时数据可能导致合规违规。
- 用户对最新答案的期望正在提高;一个反复提供过时事实的模型将很快失去信誉。
通过追踪发布日期和训练截止日期,利益相关者可以就部署哪些模型、何时使用检索工具进行补充以及何时计划模型升级做出明智的选择。
来源: 数据和解释直接取自“How Stale Is Your AI?”追踪器 (https://stale.jock.pl/) 以及相关的 Hacker News 讨论 (https://news.ycombinator.com/item?id=49726343)。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch