starVLA/starVLA
StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing
何を解決するか
StarVLA は、一般化ロボット向けの視覚言語行動(VLA)モデルの開発を簡素化するモジュール式の研究プラットフォームです。このシステムの構築における複雑さに対処するために、「レゴのような」コードベースを提供し、モデルのバックボーン、アクションヘッド、トレーニングレシピなどのコンポーネントをパイプライン全体を再実装せずに交換・統合できるようにしています。
動作方法
このプラットフォームは、トレーニングインフラストラクチャと特定のモデルアーキテクチャを分離した、非結合的で合成可能なスタックを使用しています。ユーザーは Qwenシリーズや Florence-2 などの基礎モデルバックボーンを、AR離散トークン、並列連続デコード、またはフローマッチングエキスパートなど、交換可能なアクションヘッドと組み合わせて使用できます。システムは標準化されたモデルフォワードインターフェースとモデル非依存のデータローダーを維持しており、選択したフレームワークのバリエーションに関わらず、データの流れが一貫して保たれます。
対象ユーザー
一般化ロボットポリシーの構築や、さまざまな VLAアーキテクチャ、トレーニングパラダイム、ベンチマークの実験を行うロボット研究者および開発者を主な対象としています。
特徴
- モジュール式アーキテクチャ:サブモジュールの独立したデバッグと「スモークテスト」を可能にし、迅速なプロトタイピングをサポートします。
- 多様なアクションヘッド:StarVLA-FAST、StarVLA-OFT、StarVLA-PI、StarVLA-GR00T の実装を含みます。
- 広範なベンチマーク対応:SimplerEnv、LIBERO、Robocasa、RoboTwin 2.0、RoboDojo など多数のベンチマークと統合されています。
- 柔軟なトレーニング:SFT(教師付き微調整)、マルチモーダル共同トレーニング、および RLinf を通じたRLポストトレーニングをサポートします。
- ハードウェア互換性:Ascend NPU および小規模な VLM 用の単一 A100 GPU でのトレーニングをサポートしています。
関連
- Dispatch
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト