OpenSenseNova/SenseNova-Vision
Vision as Unified Multimodal Generation
해결하는 문제
SenseNova-Vision은 컴퓨터 비전 작업의 분산 문제를 해결하기 위해, 다양한 작업을 통합된 다중 모달 생성 문제로 정식화합니다. 객체 탐지, 세그멘테이션, 깊이 추정과 같은 다양한 작업에 대해 별도의 모델이나 전용 예측 헤드를 사용하는 대신, 단일한 통합 다중 모달 모델(UMM)을 사용하여 네이티브 텍스트 및 이미지 생성을 통해 다양한 시각 작업을 처리합니다.
작동 방식
이 시스템은 시각 작업을 지시-응답 쌍으로 간주합니다. 자연어 지시문과 선택적 시각 프롬프트를 사용하여 작업을 정의합니다. 모델은 다음 세 가지 형식으로 응답을 생성합니다:
- 텍스트 생성: 경계 상자, 점, OCR 문자열, 카메라 파라미터와 같은 기호적 기록에 사용.
- 이미지 생성: 세그멘테이션 마스크, 깊이 맵, 표면 법선과 같은 밀도 높은 공간적 타겟에 사용.
- 혼합 응답: 복잡한 조합 작업을 위해 텍스트와 이미지 출력을 결합.
이를 달성하기 위해 본 프로젝트는 SenseNova-Vision Corpus를 도입하며, 태스크별 아키텍처 브랜치가 필요 없이 사전 학습된 UMM에서 모델을 훈련합니다.
대상 사용자
이 프로젝트는 일반화된 시각 모델, 다중 모달 LLM 개발에 종사하는 AI 연구자 및 개발자, 구조화된 시각 이해, 밀도 높은 기하학적 예측, 세그멘테이션을 하나의 모델로 수행할 수 있는 필요성이 있는 사용자에게 적합합니다.
주요 특징
- 통합된 정식화: 다양한 CV 작업을 UMM의 네이티브 입력-출력 공간으로 변환.
- 다양한 기능: 객체 탐지, OCR, GUI 이해, 키포인트 탐지, 단안 깊이 추정, 표면 법선 추정, 다중 뷰 재구성 지원.
- 전용 헤드 없음: 태스크별 예측 헤드나 디코더가 필요 없음.
- 대규모 코퍼스: 5000만 개의 예제를 포함하는 SenseNova-Vision Corpus.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트