Qwen3.5-9B 通过 RL 微调在目录审查中优于前沿模型,每 1k 条目成本为 $0.5

Qwen3.5-9B 通过 RL 微调在目录审查中优于前沿模型,每 1k 条目成本为 $0.5

概览

使用强化学习微调的 9B 开源模型在目录审查工作流上实现了更高的准确率和显著降低的成本,优于前沿模型。

方法论

团队使用 Amazon Berkeley Objects 数据集构建了目录工作流的数字孪生,创建了 177,767 个具有已知正确答案的审查情节。他们在两块 RTX PRO 6000 GPU 上使用开源 prime-rl 框架,在一个 GPU 上生成 rollouts,在另一个 GPU 上进行 1,000 步优化器的梯度更新,GPU 时间成本约为 $500。模型与工具交互(分类搜索、品牌查询、属性模式检索),评分器对每个情节进行评分,奖励正确输出,并对遗漏违规、不支持的属性、无效类别和浪费的工具调用进行惩罚,遗漏违规的权重是误报的 7 倍。

结果

经过 GRPO 训练的 Qwen3.5-9B 模型在基准测试中得分 0.626,相当于可达上限的 87.3%。最佳前沿配置(使用优化后的提示)达到了可达分数的 76.9%。这相较于前沿模型实现了 13.5% 的相对提升,相较于模型未训练的基础分数 64.2% 提升了 36%。五个前沿模型(GPT-5.5、GPT-5.6-sol、Gemini 3.1 Pro、Claude Opus 4.8、Claude Fable 5)在提示优化后仍在十分之一分范围内平台化。

成本分析

在运行点,微调后的专家模型每 1,000 条目成本约为 $0.50。最强的前沿模型每 1,000 条目成本为 $34,而最便宜的前沿选项每 1,000 条目成本为 $19。这相较于最强前沿模型具有 68× 的成本优势,相较于最便宜的前沿选项具有 40× 的成本优势。以每天约 4,000 万次决策的规模(据 Shopify 报道),前沿 API 使用的年度成本差异约为 $500 M,而自托管专家模型的年度成本约为 $7 M,降幅达 98%。

讨论

评论者就该方法及其可推广性提出了几点看法。

  • 一位评论者指出,前沿模型会随时间改进,因此相关的比较应针对在微调维持期间可能出现的未来模型:"每次我看到这种故事时,有两件事让我困扰。首先,我多次观察到前沿模型的免费改进超过了重新训练带来的收益。……公平的比较不应是针对今天的前沿模型,而应是针对你在维持微调期间仍在发布的任何东西。"【...】
  • 另一位评论者强调了微调所需的数据创建工作量:"昂贵的部分是创建数据并在之后维护模型。实际上有多少使用案例能够产生 177k 个已评分的情节?这里他们不得不从 Amazon Berkeley Objects 合成生成这些情节。在我看来,该数据集是文章中证明微调应用有多困难的最强证据:如果数据自然存在,就没有人需要制造它。"【...】
  • 一位评论者质疑评分器是否使用了前沿模型,以及当微调模型超越它时评分如何继续:"我喜欢那个描述何时微调模型、何时使用前沿模型等的 2x2 网格。从文章中不清楚评分器如何为每个情节评分——是前沿模型分配了等级吗?随着被微调的模型在任务上变得比前沿模型更好,这种方式如何继续有效?"【...】
  • 一些评论者对收益的规模表示怀疑,指出一个 2T 参数的前沿模型仅比未训练的 9B 模型高出约 12% 令人惊讶:"我对像 GPT 5.5 这样可能具有 2T+ 参数规模的前沿模型只比未训练的 9b 参数 LLM 高约 12% 的准确率持怀疑态度。"【...】
  • 其他人担心由于缺少 hold‑out 测试数据而导致过拟合:"似乎没有用于测试的 hold‑out 数据,所以这只是过拟合吗?"【...】

意义和检查清单

作者提出,对于频繁且结果可验证的工作,微调是有回报的。如果满足以下任意条件,则工作流是候选:

  • 它发生在高 volume(高频)情况下,以至于每个决策的成本和错误累积成真实的金钱。
  • 每个结果都可以通过规则、测试或评分表进行检查,过程中不需要人工干预。
  • 专家对正确答案的外观达成一致。
  • 有能力的模型有时已经能够成功,只是不够可靠。
  • 正确答案不能是偶然的猜测。
  • 它跨越多个步骤:推理、工具调用,然后做出承诺的决策。
  • 它在组织自己的工具、模式和政策上运行。
  • 不同的错误伴随不同的成本。
  • 敏感数据不能离开组织控制的基础设施。

当这些条件满足时,通过在内部数据上进行 RL 微调来拥有模型,相比通过 API 租用前沿模型,可以同时获得更高的性能和更低的成本。

相关工作(附录摘要)

附录列出了额外的部署案例,其中任务训练的专家模型击败了提示的前沿模型:

  • Cognition 的 SWE‑1.7 模型在编码基准上击败 GPT‑5.5,同时以极低的服务成本交付前沿级别的输出。
  • AT&T 的模型号的描述似乎被截断了,我将继续翻译剩余内容。

AT&T 的模型每天总结 900k 通支持电话,并在标记个人数据方面比 GPT‑4o 好 17%,在等效准确度下欺诈案件审查速度快 12×。

  • LinkedIn 的领域适应基础模型在匹配候选人与职位空缺方面比它替换的 GPT 模型准确率高 4%,成本比 GPT‑4 低 75×。
  • Ambience Healthcare 的医疗编码模型在金牌小组测试中超过了 18 名经过认证的医生,领先于提示的 o4‑mini 12 分。
  • Phonely 的电话客服代理准确率达到 99.2%,而 GPT‑4o 为 94.7%,响应速度快 73%,使得一位客户能够在一个月内替换 350 名人工客服。
  • OpenPipe 的电子邮件代理在支持 QA 上得分 93%,而 OpenAI 的 o3 得分 50%,运行成本低 64×,速度快 5×。
  • Perplexity 的 Sonar 在盲测用户测试中与 GPT‑4o 表现相当,同时以极低的价格提供 10× 的速度。
  • Checkr 的微调分类器在最困难的犯罪记录案例中击败 GPT‑4,运行成本比其之前的 GPT‑4 设置低 5×,速度快 30×。

结论

在评分的目录审查工作流数字孪生上,使用强化学习微调 9B 开源模型,得到的专家模型在准确率上优于前沿模型(87.3% 对比 76.9%),并将每 1,000 条目成本从 $19–$172 降低至 $0.50。该方法在高 volume、可验证的任务中最为有效,此时组织能够保留对数据和模型的控制,并且错误具有非对称成本。

Sources