InternLM/InternBootcamp
Official implement on InternBootCamp
何を解決するか
InternAgentHarness(別名:InternBootcamp)は、LLMエージェントのトレーニングおよび評価のためのスケーラブルな合成環境フレームワークを提供します。静的ベンチマークを越えて、実行可能でインタラクティブかつ検証可能なタスク環境を構築し、モデルが実際のツール呼び出し、状態フィードバック、複数ラウンドの相互作用から学習できるようにします。
仕組み
このフレームワークはエージェントタスクをトレーニング可能な環境インスタンスにカプセル化します。各タスクは以下の4つのコアコンポーネントで構成されます:
- インストラクション生成:タスクの目的、初期状態、入力コンテキストを生成します。
- ツール実行:エージェントが呼び出せる外部ツールを提供し、検証可能であることを保証します。
- インタラクション制御:モデルと環境間の複数ラウンドの通信フローを管理します。
- 報酬計算:最終結果および中間プロセスに基づいてフィードバック信号を提供します。
また、BootCampCLI を備えており、タスク設定をインタラクティブなエージェントフローに自動変換し、バッチ軌道収集、SFTデータのフィルタリング、RLロールアウト、障害分析を可能にします。
対象ユーザー
エージェントトレーニング環境の構築、モデルのツール使用能力の評価、またはタスク設計の改善に向けた複数ラウンドの相互作用軌道の収集を希望する研究者および開発者。
特徴
- 複数ラウンドのツール呼び出し:RLフレームワーク内で非同期のツール呼び出しと状態制御を必要とする複雑な推論タスクに特化。
- 検証可能な環境:バッテリー設計、ロボット軌道計画、金融予測、テキサスホールデムなど、多様なタスク例を含む。
- 分散型ツールサーバ:マスター・ワーカー構造を採用し、複数マシンにわたる高並列ツール実行をサポート。
- クローズドループワークフロー:評価、データ生成、トレーニングを1つの反復サイクルに統合。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト