yuanze-lin/Olympus

[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Computer Vision Tasks"

解决的问题

Olympus 是一个计算机视觉的通用任务路由器。它允许用户输入一个单一的自然语言指令,即可跨越多个视觉任务——例如生成图像、编辑图像,然后从该编辑后的图像创建3D模型——而无需手动串联不同的AI模型。

工作原理

Olympus 作为中央调度器运行。它将用户的提示解析为「路由令牌」,识别出所需的特定视觉任务。然后将这些任务分发给一组专业模型(例如,Qwen-Image 用于生成,TRELLIS.2-4B 用于3D生成),并自动解决它们之间的依赖关系,确保上一步的输出成为下一步的输入。

适用人群

专为需要通过自然语言单接口执行复杂多步骤计算机视觉流水线(涵盖20个不同任务)的研究人员和开发者设计。

主要亮点

  • 多任务路由: 仅通过一个提示即可支持20种不同的计算机视觉任务。
  • 资产生成: 生成完成的文件,包括 .png 图像、.mp4 视频和 .glb 3D 模型。
  • 自动链式调用: 自动处理专业模型之间的数据流,用户无需手动连接步骤。
  • 内存高效: 专业模型按需逐个加载和释放,以保持峰值GPU内存使用量较低。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目