yuanze-lin/Olympus
[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Computer Vision Tasks"
해결하는 문제
Olympus는 컴퓨터 비전을 위한 유니버설 태스크 라우터입니다. 사용자가 단일 자연어 지시를 제공함으로써, 이미지 생성, 편집, 그리고 편집된 이미지에서 3D 모델 생성과 같은 여러 비전 작업을 수동으로 다른 AI 모델을 연결하지 않고도 수행할 수 있습니다.
작동 방식
Olympus는 중앙 디스패처 역할을 합니다. 사용자의 프롬프트를 "라우팅 토큰"으로 분석하여 필요한 특정 비전 작업을 식별합니다. 그런 다음 이 작업들을 전문 모델들(예: Qwen-Image는 생성용, TRELLIS.2-4B는 3D 생성용)에 할당하고, 작업 간 의존성을 자동으로 해결하여 한 단계의 출력이 다음 단계의 입력이 되도록 보장합니다.
대상 사용자
20개의 다른 작업을 포함하는 복잡한 다단계 컴퓨터 비전 파이프라인을 자연어로 단일 인터페이스를 통해 실행해야 하는 연구자 및 개발자에게 적합합니다.
주요 특징
- 다중 작업 라우팅: 단일 프롬프트에서 20개의 다른 컴퓨터 비전 작업을 지원합니다.
- 자산 생성:
.png이미지,.mp4동영상,.glb3D 모델과 같은 완성된 파일을 생성합니다. - 자동 체이닝: 전문 모델 간의 데이터 흐름을 자동으로 처리하여 사용자가 수동으로 단계를 연결할 필요가 없습니다.
- 메모리 효율성: 전문 모델을 하나씩 로드하고 해제하여 최대 GPU 메모리 사용량을 낮춥니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트