remyxai/VQASynth

Compose multimodal datasets 🎹

해결하는 문제

VQASynth는 AI 사전 학습 데이터셋에서 고품질 공간 추론 데이터의 부족을 해결하기 위해 설계되었습니다. 사용자가 일반적인 이미지 데이터셋을 3D 공간 관계, 거리, 방향성에 특화된 시각 질문 응답(VQA) 데이터셋으로 변환할 수 있게 해줍니다. 이는 몸체 기반 AI와 로봇 공학에서 매우 중요한 요소입니다.

작동 방식

이 프로젝트는 의미적 데이터와 측정 데이터를 융합하여 합성 공간 VQA 쌍을 생성하는 파이프라인을 구현합니다. 과정은 다음과 같습니다:

  1. 위치 추정: Florence-2 및 SAM2와 같은 도구를 사용하여 작업에 관련된 객체를 탐지하고 세그먼트화합니다.
  2. 3D 재구성: VGGT를 사용하여 이미지를 3D로 변환하여 개별 객체의 포인트 클라우드, 깊이 맵, 내부 파라미터를 생성합니다.
  3. VQA 생성: 재구성된 3D 장면을 기반으로 프롬프트 생성기를 사용해 질문-답변 쌍을 생성하며, 일반적으로 Chain-of-Thought (CoT) 추론을 포함하여 정확도를 향상시킵니다.

또한, NOOA를 통해 에이전트 기반 접근 방식을 제공하여, 미리 정의된 템플릿 파이프라인에 따라가지 않고도 실시간으로 공간 질문에 답하기 위해 도구 호출(예: 측정 깊이, 객체 방향, 영역 캡셔닝)을 동적으로 조합할 수 있습니다.

대상 사용자

  • AI 연구자: 시각-언어 모델(VLM)과 공간 추론에 종사하는 연구자.
  • 로봇 개발자: 실제 환경에서 3D 거리와 객체 방향성을 이해해야 하는 몸체 기반 AI를 개발하는 엔지니어.
  • 데이터셋 큐레이터: 기존 이미지 데이터셋에 기반한 공간 주석을 추가하고 싶은 사용자.

주요 특징

  • 측정 깊이 통합: DepthPro 대신 VGGT를 사용하여 더 빠르고 정확한 측정 깊이 추정 가능.
  • 합성 데이터 생성: SpaceOm 및 SpaceThinker와 같은 데이터셋을 생성하여 VLM의 지시 조정(instruction-tuning)에 활용 가능.
  • 동적 도구 조합: 에이전트 버전은 다양한 도구(예: Orient-Anything, MediaPipe 포즈 키포인트)를 활용해 템플릿화되지 않은 유연한 공간 추론을 가능하게 함.
  • CoT 추론: VLM이 실제 세계의 객체 사전 지식과 시각적 신호를 기반으로 거리를 추정할 수 있도록 추론 흐름을 생성.
  • Lerobot 통합: VlmClient 프로토콜과 호환되어 로봇 학습 파이프라인에서 보상 또는 CoT 소스로 사용 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트