对比语言模型(CLM)实现快速代理决策
对比语言模型(CLMs)通过将动作选择视为检索问题而非生成问题,实现了高速代理决策。通过使用对比学习目标,将状态和动作嵌入对齐到共享空间中,CLM-8B 在计算机使用、游戏和工具调用任务中的表现与 Jev 相当,同时将延迟降低了高达 9 倍。
架构:状态与动作编码器的解耦
CLM 用双编码器架构替代了标准的自回归(AR)生成过程。系统由状态编码器和动作编码器组成,两者均采用冻结的 LLM 主干网络,后接可训练的 MLP 投影头(约 2000 万参数)。
- 机制:两个编码器将各自的输入映射到共享嵌入空间。状态-动作对的得分通过它们嵌入之间的余弦相似度计算得出。
- 推理效率:由于状态和动作被解耦,它们的嵌入可以独立缓存。在动作集固定(例如 Super Mario)的环境中,模型只需在每一步重新计算状态嵌入,复用缓存的动作嵌入。这将计算成本从多次前向传播降低为每步一次。
- 扩展性:在约 1000 个候选动作的情况下,CLM 的速度比 Jev 快 13 倍。
训练流程与扩展定律
CLM 分三个阶段训练,逐步优化状态-动作对齐:
- 预训练:模型在约 6000 万条 Nemotron Q&A 对上训练,使用双向 InfoNCE 损失,其中问题被视为状态,答案被视为动作。这建立了广泛的语义表示。
- 中期训练:模型接触约 3000 万条由 Gemini 2.5 Flash-Lite 生成的合成难负样本。这些样本语义相近但不正确,旨在提升细粒度区分能力。
- 后训练:模型在 Agent Data Protocol(ADP)数据集中的约 100 万条代理轨迹,以及 Endless-Terminals 和 LiteCoder-Terminal-SFT 的终端轨迹上进行训练,以适应代理环境中的表示空间。
为防止后训练阶段出现灾难性遗忘,团队采用数据回放的联合训练策略,将 40% 的 Nemotron DQA 示例与 60% 的代理轨迹混合。
扩展定律:测试对比损失与训练计算量、数据集大小、投影头大小和编码器大小呈幂律关系。扩大编码器大小带来的性能提升最为显著。最优投影头大小($N^*$)随训练 token 数量($D^{1.02}$)线性增长,平均每个参数约 310 个 token。
性能与基准测试
CLM-8B 展现出强大的验证能力,尤其在作为奖励模型从其他模型(如 Opus 5 或 Fable 5)采样的多个候选解中选择最优解时表现突出。
- 代理编程:CLM 在 DeepSWE(81.6%)和 Terminal Bench 2.1(87.6%)上达到当前最优(SOTA)水平。
- 延迟:在 H100 GPU 上,CLM 在验证任务中的推理速度比 Jev 快 4-6 倍。
- 泛化能力:预训练将模型的表示重塑为有用决策空间,使其能正确将黄金答案的排名高于基线 LLM 嵌入(如 Qwen3-8B)。
社区见解与技术批判
技术用户之间的讨论突显了对 CLM 方法的若干关键观点:
- 验证 vs. 生成:一些用户指出,DeepSWE 上的高分是通过充当验证器(从多个候选解中选择最佳解)实现的,而非从零生成解决方案。
- 归纳偏置:批评者认为,虽然余弦相似度在独立编码向量上对大 K 语义动作匹配(如 WikiRacing)有效,但在“类型化决策”任务(如日期计算或否定链)中可能表现不佳。
- 术语争议:有用户反对使用“System One”来描述该模型,认为 Kahneman 框架描述的是人类认知过程,而非适用于 AI 模型的速度分类。
- 硬件效率:在单张 RTX 4090 上约一小时内即可训练投影头,使该架构对使用消费级硬件的开发者极具吸引力。
"我认为这种方法非常酷,它确实表明,或许可以使用现代 LLM 来处理输入,然后以非常快速、非自回归的方式提取模型的下一步代理行为,其结果与常规自回归解码相当。"
未来路线图
该项目正扩展至多模态 CLM-35B,目前正处于训练中。未来目标包括将架构扩展以支持图像和视频,用于机器人和计算机使用任务,以及进一步扩展硬负样本挖掘和代理后训练的数据配方。
Sources
相关
- Dispatch
- 项目
- 项目
- 项目
- Dispatch