facebookresearch/VLM3

Official implementation of paper "VLM³: Vision Language Models Are Native 3D Learners".

何を解決するか

VLM³は3Dビジョンタスクの複雑さに対処します。従来、3D理解において高い性能を得るには、特殊なアーキテクチャや複雑な損失関数、膨大なデータ拡張が必要でした。VLM³は、こうした特別な追加要素なしに、標準的なビジョン言語モデル(VLM)がこれらのタスクを効果的に実行できることを示しています。

動作方法

このプロジェクトは標準的なVLMアーキテクチャ(特にQwen3-vl-4Bに基づく)を使用し、統一されたテキストベースの出力ドメインで教師あり微調整(SFT)により訓練します。3Dタスクに対応するため、以下の2つのキーテクニックを採用しています:

  1. 焦点距離正規化:入力画像をリサイズして、すべての画像で焦点距離を一貫させ、追加エンコーダーなしにカメラの曖昧さを排除します。
  2. 正規化座標参照:モデルは物体やピクセルを、テキストベースの正規化座標(例:[0, 2000) または [0, 1000)) で参照します。これにより、マーカーのレンダリングやアーキテクチャの変更が不要になります。

対象ユーザー

3Dビジョン、深度推定、カメラポーズ推定に取り組む研究者や開発者向けです。基礎モデルを用いた3D学習のスケーラビリティとシンプルさを求める方に最適です。

主な特徴

  • アーキテクチャの変更なし:カスタム予測ヘッドやルーティングを必要とせず、標準的なVLMアーキテクチャと損失関数で動作します。
  • 高い性能:メトリック深度推定、ピクセル対応、カメラポーズ推定において、最先端モデルと同等またはそれを上回る性能を達成しています。
  • 簡素化されたパイプライン:回転、平行移動、外観拡張などの複雑なデータ拡張の必要がありません。
  • 統一された出力:3D空間推論にシンプルなテキストベースの出力を使用しています。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch