facebookresearch/VLM3
Official implementation of paper "VLM³: Vision Language Models Are Native 3D Learners".
何を解決するか
VLM³は3Dビジョンタスクの複雑さに対処します。従来、3D理解において高い性能を得るには、特殊なアーキテクチャや複雑な損失関数、膨大なデータ拡張が必要でした。VLM³は、こうした特別な追加要素なしに、標準的なビジョン言語モデル(VLM)がこれらのタスクを効果的に実行できることを示しています。
動作方法
このプロジェクトは標準的なVLMアーキテクチャ(特にQwen3-vl-4Bに基づく)を使用し、統一されたテキストベースの出力ドメインで教師あり微調整(SFT)により訓練します。3Dタスクに対応するため、以下の2つのキーテクニックを採用しています:
- 焦点距離正規化:入力画像をリサイズして、すべての画像で焦点距離を一貫させ、追加エンコーダーなしにカメラの曖昧さを排除します。
- 正規化座標参照:モデルは物体やピクセルを、テキストベースの正規化座標(例:[0, 2000) または [0, 1000)) で参照します。これにより、マーカーのレンダリングやアーキテクチャの変更が不要になります。
対象ユーザー
3Dビジョン、深度推定、カメラポーズ推定に取り組む研究者や開発者向けです。基礎モデルを用いた3D学習のスケーラビリティとシンプルさを求める方に最適です。
主な特徴
- アーキテクチャの変更なし:カスタム予測ヘッドやルーティングを必要とせず、標準的なVLMアーキテクチャと損失関数で動作します。
- 高い性能:メトリック深度推定、ピクセル対応、カメラポーズ推定において、最先端モデルと同等またはそれを上回る性能を達成しています。
- 簡素化されたパイプライン:回転、平行移動、外観拡張などの複雑なデータ拡張の必要がありません。
- 統一された出力:3D空間推論にシンプルなテキストベースの出力を使用しています。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch