AutoSynthData:为企业代理生成训练数据
ServiceNow CoreAI 开发了 AutoSynthData,这是一个旨在弥合模型通用能力与企业环境特定需求之间差距的系统。通过利用目标模型的失败和更强的教师模型的成功,AutoSynthData 自动生成并验证合成训练任务,以提升代理在有状态企业环境中的性能。
有效代理任务的框架
为了生成有效的训练数据,AutoSynthData 将任务定义为包含系统规范、用户提示和验证器的三元组。每个组件都必须满足特定标准,以确保训练信号的质量:
- 系统规范: 定义约束、指令和环境策略。必须与环境的工具和状态兼容。
- 用户提示: 指定目标和约束。为了对训练有用,提示必须是 可行的(在环境中可解决)、现实的(类似于实际用户请求),并且 困难的(暴露代理当前的弱点)。
- 验证器: 判断成功。有效的验证器必须与提示和规范 一致,可靠(拒绝失败),并且 完整(接受所有有效解决方案)。
AutoSynthData 流水线概览
AutoSynthData 作为一个闭环系统,识别能力差距,并通过有针对性的合成数据填补这些差距。该过程包括以下主要阶段:
- 差距识别: 使用诊断任务评估目标模型。分析失败模式,并与更强的教师模型的成功轨迹进行对比。
- 能力规范: 将发现结果提炼为“能力规范卡”,描述所需的工作流、工具和成功标准,但不提供原始提示或轨迹。
- 任务生成: 生成器使用这些卡片创建新的、多样化的任务。此过程分为两个阶段:
- 目标阶段: 基于能力规范创建一组经过验证的核心示例。
- 扩展阶段: 通过创建已接受目标样本的新变体来扩展数据集,以增加规模同时限制偏差。
- 验证与修复: 每个候选任务都经过严格的质控循环,包括求解器评估、正向验证(确认解决方案有效)和负向验证(确认验证器拒绝错误结果)。
- 批评与修复: 失败的候选任务被发送给批评者进行诊断和针对性修复,而不是立即丢弃。
数据集质量与批次管理
高质量的合成数据需要在样本级别和批次级别都进行验证,以避免冗余并确保覆盖范围。
样本级别验证
候选任务根据难度优先排序:系统优先选择目标模型在三次尝试中最多解决一次,但更强的求解器在三次尝试中至少解决两次的任务。
批次级别审查
元审查过程检查已接受和被拒绝的样本,以识别任务家族的过度代表或缺失的能力维度。控制器随后调整生成策略,以在生成预算内平衡多样性并减少冗余。
企业运维训练场中的实验结果
ServiceNow 使用 EnterpriseOps Gym 基准在两个不同领域测试了 AutoSynthData,目标模型为 Gemma-4-26B-A4B-it。
混合领域
使用 Qwen3.8-27B 作为教师模型,AutoSynthData 在 18 小时内生成了 2,000 个合成样本。在该数据上对 Gemma 进行微调后,平均 Pass@1 提升了 7.2 个百分点(相对提升 35%),验证器成功率从 63.01% 提升至 68.55%。这弥补了目标模型与参考模型之间原始 Pass@1 差距的 59%。
ITSM 领域
使用 DeepSeek-V4.1-Flash 作为教师模型,系统在 66 小时内生成了 1,994 个合成样本。这使得平均 Pass@1 从 18.77% 提升至 27.18%。
推动训练前沿
AutoSynthData 将合成数据生成视为在目标模型能力边界上搜索任务的过程。由于有用训练分布会随着模型的改进而变化,该流水线设计为迭代式。在后训练阶段,模型会被重新评估,剩余的失败将指导下一轮生成。尽管这些实验聚焦于监督微调(SFT),但 ServiceNow 指出,该机制同样可用于强化学习(RL),通过生成挑战当前策略的任务来支持。