yuanze-lin/Olympus
[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Computer Vision Tasks"
解决的问题
Olympus 是一个计算机视觉的通用任务路由器。它允许用户输入一个单一的自然语言指令,即可跨越多个视觉任务——例如生成图像、编辑图像,然后从该编辑后的图像创建3D模型——而无需手动串联不同的AI模型。
工作原理
Olympus 作为中央调度器运行。它将用户的提示解析为「路由令牌」,识别出所需的特定视觉任务。然后将这些任务分发给一组专业模型(例如,Qwen-Image 用于生成,TRELLIS.2-4B 用于3D生成),并自动解决它们之间的依赖关系,确保上一步的输出成为下一步的输入。
适用人群
专为需要通过自然语言单接口执行复杂多步骤计算机视觉流水线(涵盖20个不同任务)的研究人员和开发者设计。
主要亮点
- 多任务路由: 仅通过一个提示即可支持20种不同的计算机视觉任务。
- 资产生成: 生成完成的文件,包括
.png图像、.mp4视频和.glb3D 模型。 - 自动链式调用: 自动处理专业模型之间的数据流,用户无需手动连接步骤。
- 内存高效: 专业模型按需逐个加载和释放,以保持峰值GPU内存使用量较低。
相关
- 项目
- 项目
- 项目
- 项目
- 项目