kairos-agi/kairos

Official code for world model Kairos

解決する課題

Kairosは、受動的なビデオ理解と能動的なロボット制御の間のギャップを埋めるために設計された、4Bパラメータのネイティブ・クロスエンボディメント・ワールドモデルです。異種エンボディメントデータ、弱い長期的推論、およびエンボディドAIにおけるエッジ側デプロイメントの高い計算要件などの課題に対処します。

仕組み

Kairosは、統一されたMixture-of-Transformersフレームワークを使用して、理解、生成、およびアクション予測を共同で処理します。これは、一般的なビデオから人間の行動、そして実ロボットのインタラクションデータへと段階的に移行するCross-Embodiment Data Curriculum (CEDC) を用いてトレーニングされています。効率的な長期的モデリングとリアルタイムのデプロイメントを可能にするために、Sliding-Window、Dilated Sliding-Window、およびGated Linear Attentionを組み合わせたハイブリッド線形時間メモリメカニズムを採用しています。

対象者

異なるハードウェアプラットフォーム(Agibot G1、Unitree G1、Songling PIPERなど)にわたって汎用化でき、実行可能なアクション軌道を予測できるモデルを必要とする、エンボディドインテリジェンス、ロボティクス、およびワールドモデルの研究者や開発者を対象としています。

ハイライト

  • クロスエンボディメント汎用化: シングルアーム、デュアルアーム、および器用なハンドプラットフォーム全体で動作する単一モデル。
  • ワールド・アクションモデル: 視覚的観測とタスクコンテキストから、実行可能なロボットアクションの軌道を直接予測します。
  • 効率的なエッジデプロイメント: エッジ側のGPU(例:RTX 5090、A800)での低遅延・高スループット推論に最適化されています。
  • 物理的因果的一貫性: 因果的なChain-of-Thought (CoT) を使用して、マルチモーダル入力を自律的なプランニングのための深いタスクロジックに変換します。

関連

  • Dispatch
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト