camel-ai/loong
🐉 Loong: Synthesize Long CoTs at Scale through Verifiers.
解決する課題
Project Loongは、モデルが自らの知能をブートストラップできるようにすることで、推論能力を持つモデルのスケールに関する課題に対処します。高品質な合成データを生成し、それを検証することでLLMエージェントの自己改善ループを作成することに焦点を当てており、複雑な推論タスクにおける大規模な人間によるアノテーション済みデータセットへの依存を軽減します。
仕組み
このプロジェクトは、主に3つのコンポーネントで構成されるエージェント・環境ループを実装しています:
- Generator: 小規模で高品質なシードデータセットに基づいて、合成の質問、根拠(rationale)、および回答を作成します。
- Verifier: 生成された回答の正確性を評価します。多くの場合、根拠となるコードを実行し、出力を既知の回答と比較することで行われます。
- Trainable Agent: 強化学習(RL)やその他の高度な戦略を使用して、検証済みのQ&Aペアから反復的に学習し、推論能力を向上させます。
対象者
合成データの生成、強化学習、および推論能力を持つLLMエージェントの開発に関心のあるAI研究者や開発者向けに設計されています。
ハイライト
- 多様なシードデータセット: 高等数学、物理学、化学、医学、プログラミングを含む12のドメインにわたる8,700以上の質問が含まれています。
- 自動検証: 検証器を使用して、コード実行を通じて合成データの正確性を確保します。
- モジュール式のクックブック: Few-shotプロンプティング、合成データ生成、および教師あり微調整やRLのためのデータエクスポート用の再利用可能なスクリプトを提供します。
- コラボレーションフレームワーク: 新しいシードデータセットや検証器の貢献を奨励するオープンソースのイニシアチブです。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト