camel-ai/loong

🐉 Loong: Synthesize Long CoTs at Scale through Verifiers.

解決する課題

Project Loongは、モデルが自らの知能をブートストラップできるようにすることで、推論能力を持つモデルのスケールに関する課題に対処します。高品質な合成データを生成し、それを検証することでLLMエージェントの自己改善ループを作成することに焦点を当てており、複雑な推論タスクにおける大規模な人間によるアノテーション済みデータセットへの依存を軽減します。

仕組み

このプロジェクトは、主に3つのコンポーネントで構成されるエージェント・環境ループを実装しています:

  1. Generator: 小規模で高品質なシードデータセットに基づいて、合成の質問、根拠(rationale)、および回答を作成します。
  2. Verifier: 生成された回答の正確性を評価します。多くの場合、根拠となるコードを実行し、出力を既知の回答と比較することで行われます。
  3. Trainable Agent: 強化学習(RL)やその他の高度な戦略を使用して、検証済みのQ&Aペアから反復的に学習し、推論能力を向上させます。

対象者

合成データの生成、強化学習、および推論能力を持つLLMエージェントの開発に関心のあるAI研究者や開発者向けに設計されています。

ハイライト

  • 多様なシードデータセット: 高等数学、物理学、化学、医学、プログラミングを含む12のドメインにわたる8,700以上の質問が含まれています。
  • 自動検証: 検証器を使用して、コード実行を通じて合成データの正確性を確保します。
  • モジュール式のクックブック: Few-shotプロンプティング、合成データ生成、および教師あり微調整やRLのためのデータエクスポート用の再利用可能なスクリプトを提供します。
  • コラボレーションフレームワーク: 新しいシードデータセットや検証器の貢献を奨励するオープンソースのイニシアチブです。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト