yuanze-lin/Olympus
[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Computer Vision Tasks"
何を解決するか
Olympus はコンピュータビジョン用のユニバーサルタスクルーターです。ユーザーが一連の自然言語指示を提供することで、画像生成、編集、その編集済み画像から3Dモデルを作成するなど、複数のビジョンタスクを一括で実行できます。AIモデルを手動で連鎖させる必要がありません。
動作方法
Olympus は中央ディスパッチャーとして機能します。ユーザーのプロンプトを「ルーティングトークン」に解析し、必要な特定のビジョンタスクを識別します。その後、これらのタスクを専門モデル(例:Qwen-Image による生成、TRELLIS.2-4B による3D生成)に割り当て、タスク間の依存関係を自動的に解決し、1ステップの出力が次のステップの入力となるように保証します。
対象ユーザー
20の異なるタスクをカバーする複雑なマルチステップコンピュータビジョンパイプラインを、自然言語による単一インターフェースで実行したい研究者や開発者向けに設計されています。
主な特徴
- マルチタスクルーティング: 1つのプロンプトから20の異なるコンピュータビジョンタスクをサポート。
- アセット生成:
.png画像、.mp4動画、.glb3Dモデルなどの完成ファイルを生成。 - 自動チェイニング: 専門モデル間のデータフローを自動的に処理し、ユーザーが手動でステップを接続する必要がありません。
- メモリ効率: 専門モデルを1つずつロード・解放することで、ピークGPUメモリ使用量を低く抑えます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト