探测前沿 AI 模型以获取知识截止日期和训练时间线
探测前沿 AI 模型以获取知识截止日期和训练时间线\n\n前沿 AI 模型可以通过精心设计的请求进行探测,以揭示有关其训练时间线、数据集混合比例和参数近似值的隐藏事实。通过分析每日事实的错误率和自我身份识别响应,研究人员可以估算模型的预训练检查点何时完成,以及它是否是在前代模型的输出上进行训练的。\n\n## 通过事实探测估算知识截止日期\n\n可以通过在维基百科的每日事实数据集上测试模型,并分析模型错误率上升的时间点来近似估算知识截止日期。这种方法揭示了模型的实际事实知识与其公布的知识截止日期之间的差距。\n\n### 关于模型截止日期的关键发现\n- Anthropic Opus 4.7+:这些模型似乎源自同一次训练运行,其有效知识截止日期大约在 2025 年 12 月下旬。\n- OpenAI GPT-5.6 系列:该系列可能来自一个独立于 GPT-5.5 的不同检查点,完成日期大约在 2026 年 2 月下旬。\n- Opus 5 差异:虽然 Opus 5 公布了 2026 年 5 月作为可靠的知识截止日期,但探测表明它所知道的内容并不比 2026 年 1 月截止的模型多多少,包括对编程包版本的召回率。\n\n## 前沿模型训练的三个阶段\n\n现代大语言模型 (LLM) 开发通常遵循三个阶段的收敛:\n1. 预训练:在海量的通用互联网数据抓取内容上训练一个大规模的自动补全模型,以创建一个基础检查点。\n2. 能力增强:使用特定领域的、“教科书质量”的数据来提高基础能力,例如长文本理解。\n3. 后训练:将模型微调为助手人格,侧重于推理、个性以及工具调用。\n\n已发布的模型的小版本通常是由于后训练和能力的提升,而大版本(例如从 GPT-4 到 GPT-5)通常意味着新的预训练运行。\n\n## 分析模型身份和训练混合比例\n\n通过在没有系统提示词的情况下使用“你是哪个模型?”的问题来探测模型,研究人员可以推断训练数据的组成。当模型频繁地将自己识别为特定版本或另一家实验室的模型时,它表明训练混合比例中包含来自该来源的大量数据。\n\n### 使用用户聊天记录进行训练的证据\n探测结果显示出垂直的身份识别带,表明实验室在利用前代模型的输出进行训练。对于 OpenAI,模型曾识别为 GPT-4、GPT-4o 和 GPT-5。Anthropic 模型已从识别为 3.5 Sonnet 转向 Sonnet 4.5。这种模式强烈暗示了使用来自 ChatGPT.com 和 Claude.ai 等平台的用户聊天会话作为训练材料。\n\n### 跨实验室污染\n数据表明实验室之间可能存在信息流。具体而言,Anthropic 的 Sonnet 5 定期将自己识别为 GPT-4。此外,当被要求模仿另一个模型时,Claude 模型以 68% 的成功率复现 OpenAI 的特征,而 OpenAI 模型复现 Claude 特征的成功率仅为 8%。\n\n## 社区洞察与反论点\n\n关于这些发现的技术讨论强调了 LLM 在存储和报告知识方面的几个细微差别:\n\n> "I suspect that LLMs have distinct/partitioned cutoff dates; for example, historical literature doesn't change... general knowledge (updated only in certain areas), technologies (updated regularly)... and tabloid knowledge, which is always up-to-date.",\n\n其他贡献者指出,“Opus 5”之类的营销名称可能并不代表单个静态模型,而更像是一组版本和微小更新的集合,并且在初始预训练知识截止日期之后,还会进行多轮安全和对齐训练。
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch