yuantianyuan01/FastWAM
Official codebase for Fast-WAM: Do World Action Models Need Test-time Future Imagination?
何を解決するか
FastWAMはロボティクスにおけるWorld Action Models (WAMs) の計算オーバーヘッドと遅延を軽減します。特に、『テスト時における未来の想像』(行動予測の前に将来の動画フレームを予測する)が高性能に必要かどうかを検証し、現在の観測から直接行動を予測する方法を提供することで、著しく高速な推論を実現します。
仕組み
FastWAMは、ノイズ除去コア(ActionDiT)とVAEエンコーディングに基づくモデルアーキテクチャを使用しています。主に2つの動作モードを提供します:
- 最初のフレームモード(Fast-WAM): 未来の動画想像ステップをスキップし、現在の観測から直接行動を予測することで遅延を低減します。
- IDMモード: 伝統的なアプローチに従い、まず将来の動画フレームを想像し、その想像に基づいて行動を予測します。
パフォーマンス最適化のため、このプロジェクトはコンパイル済みのノイズ除去コア、バッチ処理されたVAEエンコーディング、および軽量なCUDA Graphバックエンドを実装しており、推論時間と学習時間の両方を短縮しています。
対象ユーザー
本プロジェクトは、体現知能に焦点を当てたロボティクス研究者および開発者向けに設計されており、特に行動予測、ワールドモデル、ロボット制御ポリシーのリアルタイム性能向上に取り組んでいる方々を対象としています。
主な特徴
- 高速推論: 以前のバージョンと比較して、エンドツーエンドの推論が約2倍速くなりました。
- 二重モード対応: 「オプションIDM」バリアントにより、再トレーニングなしで、未来の想像(IDM)と直接行動予測(最初のフレーム)の切り替えが可能です。
- データセット対応: LeRobot 2.1および3.0データセットのネイティブサポートにより、大規模データに対するスケーラビリティが向上しました。
- 高い成功確率: LIBEROベンチマークにおいて、空間的、目的的、物体的、長時間スパンのタスクで優れた性能を示しました。
- 最適化されたパイプライン: 事前に計算されたT5テキスト埋め込みとコンパイル済みのトレーニングパスを含み、スループットを向上させています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch