Stanford CS329A 自我改进 AI Agent 未来研究领域讲座总结

本次讲座确定了推进自我改进 AI Agent 的四个关键研究方向:提高推理链的多样性、加强验证循环、使模型能够提出自己的训练任务,以及提高以每瓦智能度(intelligence per watt)衡量的推理效率。

推理链的多样性(多智能体微调)

使用单个语言模型生成合成数据会产生低方差的推理链,导致性能在几次微调迭代后进入平台期。多智能体微调通过采用多个专门的生成智能体(生成多样化的初始方案)和评论智能体(评估并改进这些方案)来解决这一问题。在迭代过程中,生成智能体在产生下一个响应之前会总结同行输出,而评论智能体则学习对比正确和错误的答案。这一过程能够免费获得类似于多数投票的多样性,并允许在数学基准测试(例如 Llama 显示出响应能力)和向相邻数据集(如 GSM-8k)的泛化方面持续获得性能提升,且准确率不会像单智能体微调那样出现崩溃。

验证与元验证(DeepSeekMath-V2)

仅依赖结果奖励模型无法捕捉到有缺陷的推理链,特别是在定理证明中,正确的最终答案可能会掩盖无效的步骤。DeepSeekMath-V2 引入了一个验证器(verifier),它学习在没有参考答案的情况下检测证明中的问题,以及一个元验证器(meta-verifier),用于判断验证器识别出的问题是否真实。人类对有问题的证明进行标注;验证器被训练为在 0.5-1 的范围内为证明打分;元验证器评估验证器的分析。通过迭代这个循环可以提高证明得分:经过八次迭代后得分上升,并且从 32 个生成的证明中选择最好的一个,在 2024 年 IMO 短名单测试中达到了约 42%。生成器学习倾向于更高质量的证明,从而打破了验证瓶颈。

自生成任务课程(Absolute Zero)

随着模型超越人类专业知识,策划提示词和验证任务变得成为一个瓶颈。Absolute Zero 让单个模型既能提出任务又能解决任务。提议者(proposer)根据过去案例以溯因、演绎和归纳编码任务为条件,以促进多样性,并根据任务难度(1 - 成功率)获得奖励,目标是中等难度的任务(即求解器有时成功有时失败的任务)。提出的任务通过执行、安全性检查和确定性输出检查进行验证,并使用一个种子三元组缓冲区来支持课程学习。结果显示,在没有任何人类策划的提示词数据的情况下,实现了最先进的编码性能,优于在数万个专家示例上训练的模型,且随着时间的推移复杂性和多样性不断增加,并能迁移到数学基准测试;较大的模型获益更多。

每瓦智能度效率提升

每瓦智能度(intelligence per watt)被定义为平均任务准确率除以解决任务的平均功耗,使用参数量 $\le 20B$ 的本地模型。自 2023 年以来,此类模型可解决的聊天机器人查询的比例提高了 3.1 倍,达到现实世界查询的 88.7%。硬件效率进一步贡献了 1.7 倍,在两年内实现了总计 5.3 倍的每瓦智能度提升。虽然本地加速器(例如 Apple M4 Max)落后于企业级芯片(如 B200,其每瓦智能度约为 1.5 倍较低),但这一趋势表明,越来越多的推理可以转移到边缘设备。

开放研究问题

  • 持续学习:如何以在线方式将解决问题的正面和负面经验整合到模型权重或记忆中,而不是依赖离线微调,可能通过长期记忆系统、大规模上下文窗口或知识库缓存来实现。
  • 测试时扩展(Test-time scaling)基础设施:需要针对推理过程中的重复采样、工具调用和搜索进行优化的系统,基于 hydrogen token SRS 等工作,处理高吞吐量、低延迟工作负载。
  • 混合本地-云端推理:开发动态根据查询复杂度在本地模型和云端模型之间分配流量的路由机制,以及针对本地加速器的能效型内核。
  • 不可验证领域:在芯片设计或科学模拟等地面真值(ground-truth)验证缓慢或昂贵的领域,训练奖励模型来从离线数据中预测模拟结果,承认模型泛化性取决于数据覆盖范围并存在不准确性的风险。

这些方向直接源于讲座对自我改进 AI Agent 的当前局限性和新兴机遇的分析。

SUMMARY: Stanford CS329A 讲座概述了自我改进 AI Agent 的未来研究方向,涵盖了推理链的多样性、验证瓶颈、自生成任务课程以及每瓦智能度效率的提升,表明本地模型现在可以处理大多数聊天机器人查询。

TITLE: Stanford CS329A 自我改进 AI Agent 未来研究领域讲座总结

Sources