InternRobotics/PointLLM

[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: Empowering Large Language Models to Understand Point Clouds

해결하는 문제

PointLLM은 대규모 언어 모델(LLM)이 3D 색상 포인트 클라우드를 이해할 수 있도록 하는 도전에 대응합니다. 모델이 모호한 깊이, 가림, 시점 의존성 등의 문제에 방해받지 않고 객체 유형, 기하학적 구조, 외관을 인식할 수 있도록 합니다.

작동 방식

PointLLM은 입력된 포인트 클라우드에서 특징을 추출하고, LLM 백본의 잠재 공간으로 투영하는 포인트 인코더를 사용합니다. 이후 LLM은 이러한 포인트 토큰과 텍스트 토큰을 함께 처리하여 설명적 또는 분류적 텍스트 출력을 생성합니다. 이 모델은 66만 개의 단순하고 7만 개의 복잡한 포인트-텍스트 지시어 쌍으로 구성된 새로운 데이터셋에서 이중 단계 전략으로 훈련됩니다.

대상 사용자

이 프로젝트는 3D 컴퓨터 비전, 로보틱스, 다중 모달 AI 분야에서 일하는 연구자 및 개발자들을 위한 것으로, LLM의 추론 능력과 3D 공간 이해를 통합해야 하는 사람들을 대상으로 합니다.

주요 특징

  • 다중 모달 3D 이해: 객체 분류 및 캡션 생성을 위한 색상 포인트 클라우드 이해 가능.
  • 대규모 지시어 데이터셋: 훈련을 촉진하기 위한 73만 개의 포인트-텍스트 지시어 쌍 포함.
  • 포괄적인 벤치마크: 생성형 3D 객체 분류 및 3D 객체 캡션을 위한 벤치마크 설정.
  • 유연한 평가: 전통적 메트릭과 LLM 기반 평가(ChatGPT/GPT-4) 모두 지원.
  • 즉시 사용 가능한 체크포인트: 7B 및 13B 파라미터 버전의 사전 훈련된 가중치 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch