Qwen3.5-9B Fine-tuned with RL Outperforms Frontier Models on Catalog Review at $0.5 per 1k Listings
Qwen3.5-9B Fine-tuned with RL Outperforms Frontier Models on Catalog Review at $0.5 per 1k Listings
개요
강화 학습을 사용한 파인튜닝된 9B 오픈소스 모델이 카탈로그 리뷰 워크플로에서 프론티어 모델보다 높은 정확도를 달성하고 비용을 크게 낮췄습니다.
방법론
팀은 Amazon Berkeley Objects 데이터세트를 사용하여 카탈로그 워크플로의 디지털 트윈을 구축했으며, 정답이 알려진 177,767개의 리뷰 에피소드를 만들었습니다. 두 개의 RTX PRO 6000 GPU에서 오픈소스 prime-rl 프레임워크를 사용하여 한 GPU에서 롤아웃을 생성하고 다른 GPU에서 그래디언트 업데이트를 적용하여 1,000 옵티마이저 스텝을 수행했으며, GPU 시간 비용은 약 $500 정도였습니다. 모델은 도구(분류 검색, 브랜드 조회, 속성 스키마 검색)와 상호작용했으며, 점수 매기는 모듈이 각 에피소드를 채점하여 정확한 출력에 보상을 주고, 누락된 위반, 지원되지 않는 속성, 잘못된 카테고리, 낭비된 도구 호출에 벌점을 부과했는데, 누락된 위반은 오경보보다 7배 더 높은 가중치를 가졌습니다.
결과
GRPO로 훈련된 Qwen3.5-9B 모델은 벤치마크에서 0.626점을 얻어 달성 가능한 상한선의 87.3%를 기록했습니다. 최적의 프론티어 구성(최적화된 프롬프트 사용)은 달성 가능한 점수의 76.9%에 도달했습니다. 이는 프론티어 대비 13.5%의 상대적 향상이며, 모델의 훈련되지 않은 기본 점수 64.2% 대비 36%의 향상을 의미합니다. 다섯 개의 프론티어 모델(GPT-5.5, GPT-5.6-sol, Gemini 3.1 Pro, Claude Opus 4.8, Claude Fable 5)은 프롬프트 최적화 후에도 서로 0.1점 이내에서 정체되었습니다.
비용 분석
운영 시점에서의 파인튜닝된 전문 모델 비용은 약 $0.50 per 1,000 listings입니다. 가장 강한 프론티어 모델은 $34 per 1,000 listings, 가장 저렴한 프론티어 옵션은 $19 per 1,000 listings입니다. 이로 인해 가장 강한 프론티어 모델 대비 68배의 비용 우위, 가장 저렴한 프론티어 옵션 대비 40배의 비용 우위를 얻습니다. Shopify에서 보고한 바와 같이 하루 약 4,000만 건의 결정량을 기준으로 할 때, 연간 비용 차이는 프론티어 API 사용 시 약 $500 M 대비 자체 호스팅 전문 모델 시 약 $7 M로, 98% 절감 효과가 있습니다.
토론
댓글 작성자들은 접근 방식과 그 일반화 가능성에 대해 여러 가지 의견을 제시했습니다.
- 한 댓글에서는 프론티어 모델은 시간이 지남에 따라 개선되므로, 파인튜닝을 유지하는 동안 등장할 미래 모델과의 비교가 관련 있다고 지적했습니다: "이 kinds of 이야기를 볼 때마다 두 가지가 거슬립니다. 먼저, 저는 프론티어 모델의 무료 개선이 재훈련으로부터 얻은 이익을 넘어서는 것을 여러 번 목격했습니다. ... 오늘의 프론티어가 아니라, 파인튜닝을 유지하는 동안 출시될 모델과의 비교가 공평합니다."【...】
- 또 다른 댓글에서는 파인튜닝을 위한 데이터 생성 노력을 강조했습니다: "비용이 많이 드는 부분은 데이터를 만들고 이후 모델을 유지하는 것입니다. 실제로 177k 점수를 매긴 에피소드를 생성할 수 있는 사용 사례가 몇 개나 될까요? 여기서 그들은 Amazon Berkeley Objects에서 합성적으로 이를 생성해야 했습니다. 제 생각에는 이 데이터세트가 논문에서 파인튜닝을 적용하기가 얼마나 어려운지를 보여주는 가장 강력한 증거입니다. 만약 데이터가 자연적으로 존재했다면, 아무도 이를 제조할 필요가 없을 것입니다."【...】
- 한 댓글에서는 점수 매기기가 프론티어 모델을 사용했는지, 그리고 파인튜닝된 모델이それを 초과할 때 채점이 어떻게 계속되는지에 대해 의문을 제기했습니다: "모델을 파인튜닝할 때와 프론티어 모델을 사용할 때 등을 설명하는 2x2 그리드가 마음에 듭니다. 논문에서는 점수 매기는 모듈이 각 에피소드를 어떻게 채점하는지 명확하지 않습니다 - 프론티어 모델이 점수를 부여했나요? 파인튜닝 중인 모델이 작업을 더 잘 수행하게 될 때 이는 어떻게 계속 작동하나요?"【...】
- 일부 댓글에서는 2T‑파라미터 프론티어 모델이 훈련되지 않은 9B 모델보다 약 12%만 더 정확하다는 점이 놀라워서 gain의 규모에 대해 회의감을 표했습니다: "GPT 5.5 같은 프론티어 모델은おそらく 2T+ 파라미터 규모인데, 훈련되지 않은 9B 파라미터 LLM보다 केवल 약 12% 더 정확했을 뿐이라는 점이 많이 의심스럽습니다."【...】
- 다른 이들은 홀드아웃 테스트 데이터 부족으로 인한 과적합 가능성을 우려했습니다: "테스트용 홀드아웃 데이터가 없어 보이며,这就 과적합일 뿐일 수 있습니다."【...】
함의 및 체크리스트
저자들은 검증 가능한 결과를 빈번히 내는 작업에 파인튜닝이 효과적이라고 제안합니다. 워크플로가 다음 조건 중 하나 이상을 만족하면 후보가 됩니다:
- 높은 빈도로 발생하여, 단위 결정당 비용과 오류가 실제 금액으로 누적됩니다.
- 모든 결과는 인간 개입 없이 규칙, 테스트, 또는 루브릭으로 검증할 수 있습니다.
- 전문가들이 정답의 형태에 대해 동의합니다.
- 유능한 모델이 때때로 성공하지만 안정적으로는 성공하지 못합니다.
- 정답이 운에 의한 추측일 수 없습니다.
- 여러 단계(추론, 도구 호출, 확정적인 결정)를 포함합니다.
- 조직의 자체 도구, 스키마, 정책에서 실행됩니다.
- 다양한 실수가 서로 다른 비용을 발생시킵니다.
- 민감한 데이터는 조직이 통제하는 인프라 외부로 유출될 수 없습니다.
これらの条件が満たされるとき、内部データでのRLファインチューニングによるモデル所有は、APIを通じたフロンティアモデルのレンタルよりも高いパフォーマンスと低いコストをもたらすことができます。
관련 작업 (부록 요약)
부록에서는 작업 특화 전문 모델이 프롬프트된 프론티어 모델을 이긴 추가 배포 사례를 나열합니다:
- Cognition의 SWE‑1.7 모델은 GPT‑5.5를 코딩 벤치마크에서 이기면서 서빙 비용의 일부만으로 프론티어 수준의 출력을 제공합니다.
- AT&T의 모델은 하루 900k건의 지원 전화를 요약하고 개인 데이터를 GPT‑4o보다 17% 더 잘 탐지하며, 동등한 정확도로 사기 사례를 12배 더 빠르게 검토합니다.
- LinkedIn의 도메인 적응된 기초 모델은 대체한 GPT 모델보다 직업 매칭을 4% 더 정확히 수행하며, GPT‑4 대비 75배 낮은 비용으로 달성됩니다.
- Ambience Healthcare의 의료 코딩 모델은 골드 패널 테스트에서 18명의 board‑certified 의사보다 뛰어난 성능을 보이며, 프롬프트된 o4‑mini보다 12점 앞섭니다.
- Phonely의 전화‑통화 에이전트는 GPT‑4o의 94.7% 대비 99.2% 정확도를 달성하며, 응답 속도가 73% 더 빨라 한 달에 한 고객이 350명의 인간 에이전트를 대체할 수 있게 합니다.
- OpenPipe의 이메일 에이전트는 지원 QA에서 93% 점수를 기록하며, OpenAI의 o3이 얻은 50%를 크게 상회하고, o3보다 64배 저렴하고 5배 빠르게 실행됩니다.
- Perplexity의 Sonar는 블라인드 사용자 테스트에서 GPT‑4o와 동등한 성능을 보이면서 가격의 일부만으로 10배 더 빠른 속도를 제공합니다.
- Checkr의 파인튜닝된 분류기는 가장 어려운 범죄 기록 사례에서 GPT‑4를 이기며, 이전 GPT‑4 설정 대비 5배 저렴하고 30배 빠르게 실행됩니다.
결론
강화 학습을 사용한 파인튜닝된 9B 오픈소스 모델은 카탈로그 리뷰 워크플로의 점수가 매겨진 디지털 트윈을 기반으로 훈련되어 프론티어 모델보다 정확도(87.3% 대 76.9%)에서 우위를 점하고 비용을 $19–$172 per 1,000 listings에서 $0.50 per 1,000 listings로 크게 낮췄습니다. 이 접근법은 조직이 데이터와 모델을 통제할 수 있고, 오류의 비용이 비대칭인 고빈도, 검증 가능한 작업에 가장 효과적입니다.