TianyuCodings/NanoJev

A nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline.

解決する課題

NanoJevは、従来のトークン単位のデコードを必要とせずに意思決定タスクを処理できる、Jevモデルの小型版です。状態と質問を入力として受け取り、候補群に対する完全な確率分布を直接出力することで、迷路やスネークゲームのような環境における高速かつ構造的な意思決定を可能にします。

動作方法

0.6BパラメータのQwen3バックボーンに基づき、標準的な言語モデルヘッドの代わりに専用の意思決定ヘッドを使用しています。複数の状態と質問を1回のフォワードパスで処理でき、独立した意思決定をバッチ処理できます。以下の3種類の意思決定をサポートしています:

  • 動的選択: 2~255候補に対する確率を提供。
  • 論理的判断: ある命題が真である確率を返す。
  • 順序スコア: 2~10段階の確率加重期待値を返す。

対象ユーザー

このプロジェクトは、「システム1」モデル、高効率意思決定モデル、およびAIエージェントにおけるローカル判断とコードベース計画の統合に関心を持つ研究者や開発者向けです。

特徴

  • 出力トークンのデコードゼロ: 意思決定はフォワードパスから直接読み取られ、自己回帰生成のオーバーヘッドがありません。
  • 0.6B LLMバックボーン: 構造化出力を効率的に活用するQwen3-0.6Bを採用。
  • 並列意思決定処理: 1回のフォワードパスで複数のクエリ(例:6状態と18質問)を処理可能。
  • ゲームベース評価: 50x50迷路とスネークゲームで成功を示し、調整されていないベースモデルを上回ることが多い。
  • 確率の校正: ペアドプロパー報酬学習とBrierスコアトレーニングの実装を含み、確率の質を向上させます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト