QwQ-32B リリースノート / 新機能

Qwenは、スケーリングされた強化学習(RL)を活用して、6710億パラメータのDeepSeek-R1と同等の推論能力を達成する320億パラメータのモデルであるQwQ-32Bを発表しました。このリリースは、世界知識が豊富な堅牢な基盤モデルにRLを適用することで、知能と推論効率を大幅に向上させられることを示しています。

推論のための強化学習のスケーリング

QwQ-32Bは、従来のプリトレーニングとポストトレーニングを超えて推論能力をスケーリングするため、マルチステージ強化学習アプローチを使用します。

ステージ1: ドメイン固有のRL

初期段階では、数学とコーディングのタスクに特化してRLをスケーリングします。従来の報酬モデルに依存せずに精度を確保するため、Qwenは以下を使用して結果ベースの報酬を実装しました:

  • Accuracy Verifiers: 数学の問題に対して最終解の正しさを検証するために使用されます。
  • Code Execution Servers: 生成されたコードが事前に定義されたテストケースに正常に合格するかを評価するために使用されます。

ステージ2: 汎用能力のRL

ドメイン固有の段階の後、2番目のRLステージは汎用能力に焦点を当てます。このステージは、一般的な報酬モデルとルールベースの検証器からの報酬を利用します。この短いトレーニングフェーズは、数学またはコーディングの習熟度に大きな低下を引き起こさずに、指示への従順さ、人間の好みへの適合、およびエージェントのパフォーマンスを向上させます。

モデルの機能とパフォーマンス

QwQ-32Bは、複雑な問題解決、数学的推論、およびコーディングのために設計されています。エージェント関連の機能を統合し、ツールを使用しながら環境からのフィードバックに基づいて批判的に考え、推論を適応させることを可能にします。

パフォーマンス評価によると、QwQ-32Bは次の主要なモデルと競争力があります:

  • DeepSeek-R1
  • o1-mini
  • DeepSeek-R1-Distilled-Llama-70B
  • DeepSeek-R1-Distilled-Qwen-32B

デプロイとアクセシビリティ

QwQ-32Bは、Apache 2.0ライセンスの下でリリースされたオープンウェイトモデルです。次のチャネルを通じて利用可能です:

  • Hugging Face and ModelScope: Transformersを介したローカルデプロイのためのオープンウェイトアクセス。
  • Qwen Chat: ウェブインターフェース経由でアクセス可能。
  • Alibaba Cloud DashScope API: プログラムによる統合のために利用可能。

今後の研究方向性

Qwenは、人工一般知能(AGI)に向かって進むため、基盤モデルとスケーリングされたRLの交差点をさらに探求する意向です。今後の重点分野には以下が含まれます:

  • Inference Time Scaling: 推論プロセス中の計算をスケーリングすることで、より高い知能を解き放ちます。
  • Long-Horizon Reasoning: エージェントとRLを統合し、モデルが長期間にわたって複雑でマルチステップの推論タスクを処理できるようにします。

Sources