AkaliKong/MiniOneRec

Minimal reproduction of OneRec

What it solves

MiniOneRec は、生成型推薦システムのスケーリングの課題に対解します。従来の推薦タスクを、大規模言語モデル (LLM) が次のアイテムを離散的なトークンとして予測する生成プロセスへと変換する、完全なエンドツーエンドのパイプラインを提供します。従来のランキング手法に依存するのではなく、生成プロセスへと変換します。

How it works

このフレームワークは、主に 3 つの段階で動作します:

  1. SID Construction: すべての製品は、コンパクトで意味のあるトークンである「セマンティックID」 (SID) に変換されます。これは、凍結されたテキストエンコーダーを通じてアイテムのタイトルと説明をエンコードし、RQ-VAE や RQ-Kmeans を用いて埋め込みを量子化することで行われます。
  2. Supervised Fine-Tuning (SFT): LLM は、ユーザーの履歴を SIDs のシーケンスとして扱い、次の SID を予測するように訓練されます。この段階では、自然言語と SID 空間の間のマッピングを可能にするための言語アライメント目的関数が含まれます。
  3. Recommendation-Oriented RL: Group Relative Policy Optimization (GRPO) を使用してモデルをさらに精錬します。これは、生成されたトークンが有効な SID であることを保証するために制約付きビームサーチを使用し、バイナリの正確性とランク意識のペナルティを組み合わせた報酬信号を用いて、精度と多様性を向上させます。

Who it’s for

SID の作成、SFT、および強化学習のための標準化されたワークフローを構築している、生成型推薦システムを構築する AI 研究者や開発者向けに設計されています。

Highlights

  • End-to-End Pipeline: 生データの前処理、SID 生成、最終的な RL 精錬まで、すべてをカバーしています。
  • Flexible SID Generation: RQ-VAE、RQ-Kmeans、および制約付き RQ-Kmeans を含む複数の量子化手法を支持します。
  • Constrained Decoding: モデルが有効なアイテム ID をのみ生成するように保証するために、logit processor を実装しています。
  • RL Integration: GRPO を使用して、正確性とランキング指標に基づいて推薦を最適化します。