TokenRhythm/NeoHorse
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.
何を解決するか
NeoHorse-1は、再帰的自己改善(RSI)が可能なモデルを構築する課題に対処しています。静的学習から脱却し、エージェントタスク、ツール利用、コーディングにおける実際のパフォーマンスに基づいて、モデルの評価・選択・更新を行うループを構築することを目指しています。
動作方法
NeoHorse-1は「ルーティングハarness」を用いて、複数のモデルを管理するプールを構成します。このハarnessはタスクを割り当て、ツールの使用状況と結果を記録し、特定の能力に対する需要を推定します。このフィードバックは次のトレーニングミックスにフィードバックされます。プロジェクトは、ルーティングガイド付きカリキュラムSFT(Supervised Fine-Tuning)とオンポリシー蒸留を特徴とするエージェントベースのポストトレーニングフレームワークを採用しており、実行トラジェクトリをトレーニング信号に変換しつつ、ハarnessのコンテキストを維持しています。
対象ユーザー
エージェントネイティブな因果言語モデルに注力する開発者や研究者向けに設計されており、特にツール利用や指示追従タスクに適した、効率的なローカルデプロイメント(4Bモデル)またはより高い能力(9Bモデル)を必要とするユーザーに適しています。
主な特徴
- 再帰的自己改善のプロトタイプ:評価–選択–更新のループを実装し、モデル能力を段階的に向上させます。
- エージェントベースのポストトレーニング:ルーティングガイド付きカリキュラムSFTとオンポリシー蒸留を用いてモデルを精緻化します。
- 高品質なデータパイプライン:厳格な重複削除、評価の汚染除去、およびシーン/目的/結果レベルのラベル付けを含みます。
- 柔軟なデプロイメント:GGUFおよび量子化バージョンを備えた4Bおよび9Bパラメータサイズで提供され、ローカルハードウェアでの実行が容易です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト