lxtGH/OMG-Seg
Official Repo For OMG-LLaVA and OMG-Seg codebase [CVPR-24 and NeurIPS-24]
何を解決するか
OMG-SegとOMG-LLaVAは、広範な視覚的知覚および推論タスクを処理できる単一の統合モデルによって、複数の特化型ビジョンモデルを置き換えることを目的としています。大規模言語モデル(LLM)を使用して個別の専門家モデルをオーケストレートする代わりに、これらのフレームワークはピクセルレベルの理解と推論のためのエンドツーエンドのソリューションを提供します。
仕組み
- OMG-Seg: タスク固有のクエリと出力を使用するTransformerベースのエンコーダー・デコーダー・アーキテクチャであり、10種類以上の異なるセグメンテーションタスク(画像およびビデオの両方に対するセマンティック、インスタンス、およびパノプティック・セグメンテーション、ならびにオープンボキャブラリーおよびインタラクティブ・セグメンテーションを含む)を処理します。
- OMG-LLaVA: 汎用的なセグメンテーション手法をビジュアルエンコーダーとしてLLMと組み合わせます。画像情報、知覚の事前知識、および視覚的プロンプトを、LLMがユーザーの指示に基づいてテキスト応答とピクセルレベルのセグメンテーション結果を提供するために使用するトークンへと統合します。
対象者
コンピュータビジョンとマルチモーダルLLMに焦点を当て当てている研究者や学術研究室、特に、高密度予測タスクのための計算オーバーヘッドを削減し、モデルアーキテクチャを簡素化することに関心がある人々。
ハイライト
- Unified Architecture: 複数の高密度予測タスクを一度に共同トレーニングすることをサポートします。
- Universal Segmentation: OMG-Segは、単一のモデル内で画像、ビデオ、およびオープンボキャブラリー・セグメンテーションを処理します。
- Efficiency: OMG-Segは、トレーニング可能なパラメータをわずか70Mしか使用せず、単一の32GB V100または40GB A100 GPUで再現可能です。
- End-to-End: 画像レベル、オブジェクトレベル、およびピクセルレベルの推論を、単一のコードベース内で橋渡しします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト