yuanze-lin/Olympus
[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Computer Vision Tasks"
解決的問題
Olympus 是電腦視覺的通用任務路由器。它允許使用者提供單一的自然語言指令,即可跨越多個視覺任務——例如生成影像、編輯影像,再從該編輯後的影像建立3D模型——而無需手動串接不同的AI模型。
工作原理
Olympus 作為中央調度器運作。它將使用者的提示解析為「路由權杖」,識別出所需的特定視覺任務。然後將這些任務分派給一組專業模型(例如,Qwen-Image 用於生成,TRELLIS.2-4B 用於3D生成),並自動解決它們之間的依賴關係,確保上一步的輸出成為下一步的輸入。
適用對象
專為需要透過自然語言單一介面執行複雜多步驟電腦視覺流程(涵蓋20種不同任務)的研究人員與開發者設計。
主要亮點
- 多任務路由: 僅透過一個提示即可支援20種不同的電腦視覺任務。
- 資產生成: 產生完成的檔案,包括
.png影像、.mp4影片和.glb3D 模型。 - 自動鏈式調用: 自動處理專業模型之間的資料流,使用者無需手動串接步驟。
- 記憶體高效: 專業模型依需求逐一載入與釋放,以維持峰值GPU記憶體使用量低。
相關
- 專案
- 專案
- 專案
- 專案
- 專案