yuanze-lin/Olympus

[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Computer Vision Tasks"

何を解決するか

Olympus はコンピュータビジョン用のユニバーサルタスクルーターです。ユーザーが一連の自然言語指示を提供することで、画像生成、編集、その編集済み画像から3Dモデルを作成するなど、複数のビジョンタスクを一括で実行できます。AIモデルを手動で連鎖させる必要がありません。

動作方法

Olympus は中央ディスパッチャーとして機能します。ユーザーのプロンプトを「ルーティングトークン」に解析し、必要な特定のビジョンタスクを識別します。その後、これらのタスクを専門モデル(例:Qwen-Image による生成、TRELLIS.2-4B による3D生成)に割り当て、タスク間の依存関係を自動的に解決し、1ステップの出力が次のステップの入力となるように保証します。

対象ユーザー

20の異なるタスクをカバーする複雑なマルチステップコンピュータビジョンパイプラインを、自然言語による単一インターフェースで実行したい研究者や開発者向けに設計されています。

主な特徴

  • マルチタスクルーティング: 1つのプロンプトから20の異なるコンピュータビジョンタスクをサポート。
  • アセット生成: .png 画像、.mp4 動画、.glb 3Dモデルなどの完成ファイルを生成。
  • 自動チェイニング: 専門モデル間のデータフローを自動的に処理し、ユーザーが手動でステップを接続する必要がありません。
  • メモリ効率: 専門モデルを1つずつロード・解放することで、ピークGPUメモリ使用量を低く抑えます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト