Jeff Dean 谈 AI 计算的未来、推理专用化与持续学习
核心论点:计算规模化与自主工程之路
在未来十年内,计算能力提升 1,000,000 倍可能会将 AI 从被动的 token 预测转向自主问题求解。Jeff Dean 认为,这种规模的计算结合多代理工作流和仿真环境,能够让 AI 在数天而非数年内完成复杂的工程任务——例如设计飞机或新型计算芯片。
克服训练数据瓶颈
与行业认为高质量文本数据即将枯竭的观点相反,Jeff Dean 认为通过以下几条途径仍有显著增长空间:
- 未开发的模态: 有大量视频数据尚未被充分用于训练。
- 合成数据与强化学习: 强化学习(RL)回滚可以生成高质量的合成数据。通过探索数千种可能的编码问题解法,并筛选出能够编译并通过单元测试的方案,模型可以自行创建高质量的训练集。
- 跨语言增强: 在一种语言(例如 Python)中验证过的代码可以作为完整的提示,用于生成另一种语言(例如 Go)中等效且高性能的代码,从而有效地用已验证的行为数据增强训练集。
- 算法效率: 新技术可以让模型通过多次遍历从现有数据中提取更多信息。
向推理专用硬件的转变
数据中心的机器学习工作负载正大幅转向推理。这一转变需要从通用训练硬件转向专用的推理硅片。
为什么专用化重要
推理工作负载在多个关键方面与训练不同:
- 精度要求: 推理可以在更低的精度下运行。Dean 指出 FP4(4 位浮点)出奇地有效,并且进一步降至 2 位或 1 位整数并结合缩放因子也是可能的。
- 权重稳定性: 与训练不同,模型权重在推理期间不变,这使得硬件可以优化以优先考虑能效和吞吐量,而非灵活性。
- 规模: 代理行为和离线 RL 回滚的增加提升了推理请求的总体量,要求更高的每瓦性能和更低的延迟。
Google 已经通过 TPU 8i 和 8t 芯片开始了这一转变,这些芯片专门用于处理这些不同的计算特性。
合并预训练与后训练
Jeff Dean 认为当前预训练与后训练之间的严格分离在“智力上令人不满意”。他主张采用交错的学习方式:
- 主动学习: 模型不应仅被动观察 token,而应在模拟或真实环境中采取行动,观察结果并从中学习。
- 持续学习循环: 理想状态是观察数据并通过行动应用这些知识的循环。虽然在模型向用户发布前仍需进行安全协议和红队测试,但底层模型应在幕后持续学习。
解决 “终身 AI” 的注意力问题
要实现 “终身 AI”——即能够访问用户完整数字历史或公司完整代码库的系统,业界必须突破标准注意力机制的二次成本($O(n^2)$)。
无限上下文的策略
由于完整的注意力机制对数十亿 token 来说成本过高,Dean 建议采用级联检索架构:
- 广泛检索: 系统从数十亿文档中识别出几千个相关文档。
- 精细过滤: 轻量模型将其进一步筛选为一小批高度相关的片段(例如 117 条)。
- 高精度处理: 将这些片段放入更大、更强模型的昂贵上下文窗口中。
这种编排在保持计算可行性的同时,营造出巨大的上下文窗口的幻象。
蒸馏与开源生态系统
知识蒸馏是将前沿水平能力提供给更小、更快模型的主要机制。Dean 解释说,使得小模型(如 Flash 系列或 Gemma)几乎能与前沿模型匹敌的“魔法酱”是使用更大、更强的模型来教导小模型的过程。
这形成了共生关系:业界必须继续构建庞大、效率较低的前沿模型,专门为将其知识蒸馏到生产中使用的高效“主力”模型中。
大规模工程:宇宙射线与硬件故障
在 Google 规模的数据中心运营表明硬件本质上不可靠。Dean 强调了大规模系统的几个关键现实:
- 宇宙射线: 来自遥远超新星的阿尔法粒子可能导致 DRAM 单比特翻转。Google 通过 ECC(错误纠正码)内存监控这些错误,并观察到在特定宇宙事件期间,面向特定方向的集群错误率会更高。
- 通过软件实现可靠性: 由于硬件会失效,Google 专注于用不可靠的部件构建可靠系统。早期,这包括构建基于软件的校验和系统,以处理缺乏 ECC 内存的消费级硬件上的数据损坏。