你的 AI 有多过时?20 款主流模型的发布日期与训练截止日期

TL;DR – 模型的新鲜度差异巨大;许多顶级模型在训练数据截止数月后才发布,且 8 家实验室中仅有 5 家公开披露了截止日期。


该追踪器衡量的内容

结论: “Stale AI”页面为每个模型列出了两个时间戳——发布日期(模型公开可用的时间)和训练截止日期(模型所训练数据的最新日期)。两者之间的差距量化了模型在发布时知识的过时程度。

  • 该网站追踪了来自 8 家主要实验室(Meta、Anthropic、Mistral AI、Google DeepMind、OpenAI、Alibaba、xAI、DeepSeek)的 20 款模型。
  • 数据会自动刷新;计数器会从每个日期开始向上累加。
  • 一个 JSON 转储文件 (models.json) 提供了用于程序化调用的原始数据。

发布日期与训练截止日期的差距

结论: 最大的差距超过五个月,这意味着用户正在与缺乏半年旧信息的模型进行交互。

模型 实验室 发布日期 训练截止日期 差距(月)
Llama 4 Meta 2025年4月5日 2024年8月 ~8
Claude Haiku 4.5 Anthropic 2025年10月15日 2025年7月 ~3
Gemini 3.1 Pro Google DeepMind 2026年2月19日 2025年1月 ~13
Claude Sonnet 5 Anthropic 2026年6月30日 2026年1月 ~5
GPT-5.6 Sol / Luna OpenAI 2026年7月9日 2026年2月16日 ~5
Claude Opus 5 Anthropic 2026年7月24日 2026年5月 ~2
Grok 4.6 xAI 2026年8月12日 2026年2月1日 ~6
GPT-6 Astra OpenAI 2026年9月3日 2026年4月30日 ~4

标记为“未确定”的模型没有公布截止日期,因此无法计算差距。

发布截止日期的实验室

结论: 只有五家实验室(Anthropic、Google DeepMind、Meta、OpenAI、xAI)提供了至少一个官方截止日期;其余三家(Mistral AI、Alibaba、DeepSeek)则没有。

  • 在列出的 20 款模型中,有 10 款披露了截止日期。
  • 空白条目并证明该实验室从未发布过日期;它仅表示作者未能找到相关信息。

网络搜索工具能弥补差距吗?

结论: 不能。搜索增强型响应仅将外部页面用于当前查询,并不会更新模型的内部知识库。

“当模型为你搜索网络时,它并没有学习任何东西。它阅读了几页内容,在那个回答中使用它们,然后就忘记了。打开一个新的聊天窗口,时间又回到了四月。搜索工具只是掩盖了差距,它们从未真正消除差距。”

因此,依赖浏览功能来弥补过时的训练数据是一种临时修复,而非永久解决方案。

来自 Hacker News 的社区观察

结论: 从业者在结合推理、工具使用和网络搜索时,较少注意到数据过时的问题,但该问题在具体案例中依然会出现。

  • gjskngnf 报告称,在提示模型通过 Reuters 验证某项声明后,模型最终接受了事实,这表明显式的来源检查可以克服过时的知识。
  • jasonjmcghee 附和道,良好的推理和工具使用减少了截止日期的影响。
  • delichon 描述了一个现实中的失败案例:模型在 2024 年大选后数月仍将 Joe Biden 识别为总统,直到被迫浏览网页时才自行纠正。
  • VCFundedGenYer 强调,较旧的自托管模型(例如 Ollama 容器)仍然带有 2023 年的截止日期,这对许多应用来说是不可接受的。
  • asimovDev 指出了一个具体错误,Qwen-3.8 生成了 2025 年的版权页脚,并假设了 Astro 框架的过时版本。

这些轶事证实,过时的知识可能导致事实错误,特别是在政治、软件版本和版权日期等对时间敏感的领域。

给开发者的实用建议

结论: 将模型知识视为一个快照,并始终使用外部来源验证对时间敏感的事实。

  1. 询问模型的截止日期 – 表现良好的模型要么会披露日期,要么会承认不确定性。请根据追踪器核实答案。
  2. 对任何关于近期事件、软件发布或监管变更的查询使用显式网络搜索工具
  3. 在新鲜度至关重要时,优先选择有公布截止日期的模型;披露的日期为模型所知的内容提供了明确的界限。
  4. 监控模型发布 – 追踪器会自动更新,因此你可以通过编程方式在有更新、差距更小的模型可用时提醒你的团队。

为什么新鲜度很重要

结论: 过时的知识可能导致错误信息、法律风险和用户信任度下降,尤其是在 AI 成为主要信息来源的情况下。

  • 五个月的滞后意味着模型无法了解截止日期之后发生的重大事件,如选举、政策变化或软件发布。
  • 在受监管的行业(金融、医疗保健)中,依赖过时数据可能导致合规违规。
  • 用户对最新答案的期望正在提高;一个反复提供过时事实的模型将很快失去信誉。

通过追踪发布日期和训练截止日期,利益相关者可以就部署哪些模型、何时使用检索工具进行补充以及何时计划模型升级做出明智的选择。


来源: 数据和解释直接取自“How Stale Is Your AI?”追踪器 (https://stale.jock.pl/) 以及相关的 Hacker News 讨论 (https://news.ycombinator.com/item?id=49726343)。

Sources

相关