斯坦福 CS329A: AI代理的测试时计算缩放

测试时计算缩放概述

测试时计算缩放使得AI模型能够在不更改模型参数或进行额外微调的情况下提升性能。传统LLM开发侧重于预训练(高计算量、长周期)和微调(低计算量),而测时缩放则将计算预算转移到推理阶段,以从现有模型中获得更好的响应。

并行采样与覆盖率的幂律

重复并行采样指的是多次向模型提交相同的输入问题,并使用验证器选择正确的响应。这种方法可以使较小、较弱的模型(例如 Llama 3-8B)在特定任务上超越更大的专有模型(例如 GPT-4o)。

推理的缩放定律

研究表明,覆盖率(至少有一个样本解决的问题比例)与**样本数量(k)**之间的关系遵循指数幂律。这使工程师能够预测在不同模型规模和领域中实现特定覆盖目标所需的资源。

困难问题的长尾

这种幂律行为源于问题难度的分布。大多数问题在 "pass@1" 时被解决,但存在一组模型仅罕见解决的复杂问题的"长尾"。增加样本数量会提高在这些最难问题上命中罕见正确解决方案的概率。

生成-验证差距

模型通常能够在大样本集中生成正确答案,但识别该答案的能力是一个独立的挑战,称为 生成-验证差距

可验证 vs. 不可验证领域

  • 可验证领域: 在编码(通过单元测试)、数学(通过形式证明)或语言翻译(通过等价检查)中,存在完美或近乎完美的验证器。例如,在CUDA代码生成中,输出可以通过与源PyTorch代码输出进行比较来验证。
  • 不可验证领域: 在没有自动验证器的领域中,诸如 多数投票(选择出现频率最高的答案)之类的方法往往会快速平台化,并且无法捕捉到困难问题的罕见正确答案。即使是基于LLM的奖励模型也常常在当前验证能力与模型真实覆盖率之间留下显著差距。

优化测时计算:并行 vs. 顺序

除了简单的重复采样,计算还可以通过顺序修订和引导搜索进行扩展。

顺序修订

与并行尝试不同,模型会生成一个初始方法并进行迭代修订。这种顺序方法使模型能够从不同角度审视问题并完善其逻辑。

结果奖励模型 vs. 过程奖励模型

  • 结果奖励模型(ORM): 对响应的最终答案进行评分。
  • 过程奖励模型(PRM): 对生成过程的每个单独步骤进行评分。PRM可用于引导 束搜索,其中模型仅根据逐步得分扩展最有希望的推理路径。

预训练 vs. 测时缩放

对于简单和中等难度的问题,增加测时计算通常比增加预训练令牌更具计算效率。然而,对于最难的问题,具有更广泛预训练的更大模型仍然保持性能优势,即使有显著的测时计算预算。

Archon:推理时架构搜索

Archon是一个将推理缩放视为架构设计问题的框架,使用贝叶斯优化器在给定计算预算下寻找模型和技术的最佳组合。

推理时操作

Archon利用几个关键操作: 操作:

  • 生成: 从一个或多个LLM进行标准采样。
  • 融合: 要求LLM基于多个候选响应合成单个最终答案。
  • 批评: 使用模型描述响应的优点和缺点。
  • 排名: 提示模型根据质量对候选进行排序。
  • 单元测试生成: 生成测试以验证解决方案的正确性。

Archon的主要发现

  • 深层架构: 堆叠多层批评、排名和融合(创建"深度"推理架构)可显著提高准确率。
  • 性能提升: 通过优化这些架构,开源模型可以匹配或超过前沿闭源模型。Archon报告在推理、数学和编码任务上相较于GPT-4和Claude 3.5 Sonnet的pass@1准确率平均提升 14.1%
  • 泛化能力: 针对特定任务优化的架构也可以设计为通用系统,在各种基准测试中表现良好。

Sources