Qwen3.5-9B 使用強化學習微調後在目錄審閱上勝過前沿模型,每 1k 列表成本為 $0.5

Qwen3.5-9B 使用強化學習微調後在目錄審閱上勝過前沿模型,每 1k 列表成本為 $0.5

總覽

使用強化學習微調的 9B 開源模型在目錄審閱工作流程上達到了比前沿模型更高的準確度並大幅降低成本。

方法論

團隊使用 Amazon Berkeley Objects 資料集建立了目錄工作流程的數位雙胞胎,創建了 177,767 個具有已知正確答案的審閱情節。他們在兩塊 RTX PRO 6000 GPU 上使用開源 prime-rl 框架,在一塊 GPU 上生成 rollouts,在另一塊 GPU 上進行梯度更新,進行了 1,000 個優化步驟,GPU 時間成本約為 $500。模型與工具互動(分類搜尋、品牌查詢、屬性 schema 檢索),而評分器為每個情節評分,給予正確輸出獎勵,並對遺漏違規、不支援的屬性、無效類別和浪費的工具調用進行懲罰,遺漏違規的權重是誤報的 7 倍。

結果

經 GRPO 訓練的 Qwen3.5-9B 模型在基準上得分為 0.626,這是可達成上限的 87.3%。最佳前沿配置(使用優化提示)達到了可達成分數的 76.9%。這相較於前沿模型有 13.5% 的相對提升,相較於模型未訓練的基礎分數 64.2% 有 36% 的提升。五個前沿模型(GPT-5.5、GPT-5.6-sol、Gemini 3.1 Pro、Claude Opus 4.8、Claude Fable 5)即使在提示優化後也僅相差十分之一分,彼此平台。

成本分析

在操作點上,微調專家模型每 1,000 列表的成本約為 $0.50。最強的前沿模型每 1,000 列表成本為 $34,而最便宜的前沿選項每 1,000 列表成本為 $19。這相較於最強前沿模型有 68× 的成本優勢,相較於最便宜的前沿選項有 40× 的優勢。以每天約 4,000 萬次決策的規模(如 Shopify 所報告),前沿 API 使用的年度成本差異約為 $500 M,而自託管專家模型的成本約為 $7 M,減少了 98%。

討論

評論者對此方法及其普遍性提出了幾點看法。

  • 一則評論指出,前沿模型會隨時間改進,因此相關的比較應該是未來可能出現的模型,而在維護微調期間:"每次我看到這種故事時,有兩件事讓我困擾。首先,我已經觀察到前沿模型的免費改進多次超越了重新訓練帶來的收益。……公平的比較不應該是針對今天的前沿模型,而是針對你仍在維護微調期間所推出的任何東西。"【...】
  • 另一則評論強調了微調所需的資料創建工作量:"昂貴的部分是創建資料以及之後維護模型。實際上有多少使用案例能夠產生 177k 個已評分的情節?這裡他們必須從 Amazon Berkeley Objects 合成生成它們。對我來說,這個資料集是文章中最有力的證據,說明微調的應用有多麼困難:如果資料自然存在,就沒有人需要製造它。"【...】
  • 一則評論質疑評分器是否使用了前沿模型,以及當微調模型超越它時評分如何繼續進行:"我喜歡這個 2x2 網格,它描述了何時應該微調模型、何時應該使用前沿模型等。從文章中不清楚評分器如何為每個情節評分——是否是前沿模型分配了等級?當被微調的模型在任務上變得比前沿模型更優時,這樣的評分方式如何繼續有效?"【...】
  • 有些評論者對收益的 magnitude 指懷疑,指出只有 ~12% 優於未訓練的 9B 模型的 2T‑參數前沿模型似乎令人驚訝:"我對像 GPT 5.5 這樣可能具有 2T+ 參數規模的前沿模型只比未訓練的 9b 參數 LLM 準確高約 12% 持懷疑態度。"【...】
  • 其他人則擔心因缺少保留測試資料而導致過擬合:"似乎沒有保留的測試資料,所以這只是過擬合嗎?"【...】

意義與檢查表

作者提出,對於頻繁且可驗證結果的工作,微調是值得的。如果工作流程符合以下任一條件,則該工作流程是候選者:

  • 它發生的頻率很高,以至于每個決策的成本和錯誤會累積成真實的金錢。
  • 每個結果都可以透過規則、測試或評分規則進行檢查,且過程中不需要人工介入。
  • 專家對正確答案的外觀有共識。
  • 有能力的模型偶爾會成功,但不夠可靠。
  • 正答案不能是僥倖的猜測。
  • 它涵蓋多個步驟:推理、工具調用,然後做出承諾的決策。
  • 它在組織自己的工具、schema 和政策上運行。
  • 不同的錯誤帶有不同的成本。
  • 敏感資料不能離開組織控制的基礎設施。

當這些條件成立時,透過內部資料進行 RL 微調來擁有模型,可以同時提供比透過 API 租用前沿模型更高的效能和更低的成本。

相關工作(附錄摘要)

附錄列出了額外的部署案例,其中任務訓練的專家模型擊敗了提示的前沿模型:

  • Cognition 的 SWE‑1.7 模型在編碼基準上擊敗 GPT‑5.5,同時以極低的服務成本交付前沿級輸出。
  • AT&T 的模型每天總結 900k 通支援電話,並在標記個人資料方面比 GPT‑4o 好 17%,在相當準確度下以 12× 的速度審查詐騙案件。
  • LinkedIn 的域適應基礎模型在將候選人匹配到職缺方面比其取代的 GPT 模型準確 4%,成本僅為 GPT‑4 的 75×。
  • Ambience Healthcare 的醫療編碼模型在金標準測試上超過 18 位具有董事會認證的醫生,領先於提示的 o4‑mini 12 分。
  • Phonely 的電話客服代理達到 99.2% 的準確率,而 GPT‑4o 為 94.7%,反應速度快 73%,並使一位客戶能在一個月內取代 350 名人工客服。
  • OpenPipe 的電子郵件代理在支援 QA 上得分 93%,而 OpenAI 的 o3 得分 50%,運行成本便宜 64×且速度快 5×。
  • Perplexity 的 Sonar 在盲測使用者測試中與 GPT‑4o 表現相同,但速度快 10×且價格僅為其一小部分。
  • Checkr 的微調分類器在最難的犯罪記錄案例上擊敗 GPT‑4,運行成本比其先前的 GPT‑4 設置便宜 5×且速度快 30×。

結論

在得分的目錄審閱工作流程的數位雙胞胎上,使用強化學習微調 9B 開源模型產生了一個專家模型,在準確度方面優於前沿模型(87.3% 對 76.9%),並將每 1,000 列表的成本從 $19–$172 降低至 $0.50。此方法最適合高頻率、可驗證的任務,其中組織能夠保留對資料和模型的控制,且錯誤具有非對稱成本。

Sources