OpenSenseNova/SenseNova-Vision

Vision as Unified Multimodal Generation

何を解決するか

SenseNova-Visionは、コンピュータビジョンのタスクの断片化を解決するために、それらを統一されたマルチモーダル生成問題として定式化します。オブジェクト検出、セグメンテーション、深度推定などの異なるタスクにそれぞれ別々のモデルや専用の予測ヘッドを使用するのではなく、単一の統一マルチモーダルモデル(UMM)を用いて、ネイティブなテキストおよび画像生成を通じて多様な視覚タスクを処理します。

仕組み

このシステムは視覚タスクをインストラクション-レスポンスペアとして扱います。自然言語によるインストラクションとオプションの視覚プロンプトを使ってタスクを定義します。その後、モデルは以下の3つの形式で応答を生成します:

  • テキスト生成:バウンディングボックス、ポイント、OCR文字列、カメラパラメータなどの記号的記録に使用。
  • 画像生成:セグメンテーションマスク、深度マップ、表面法線などの密な空間的ターゲットに使用。
  • 混合応答:複雑な構成タスクのため、テキストと画像の両方の出力を組み合わせます。

これを実現するために、本プロジェクトはSenseNova-Vision Corpus(大規模なコンピュータビジョンインストラクション-レスポンス例のデータセット)を導入し、タスク固有のアーキテクチャのブランチを必要とせずに、事前学習済みUMMからモデルを訓練します。

対象ユーザー

このプロジェクトは、汎用視覚モデルやマルチモーダルLLMの開発に取り組むAI研究者や開発者、構造化された視覚理解、密な幾何学的予測、セグメンテーションを1つのモデルで行える必要がある方々に向けられています。

主な特徴

  • 統一された定式化:多様なCVタスクをUMMのネイティブな入出力空間に統合。
  • 多様な機能:オブジェクト検出、OCR、GUI理解、キーポイント検出、単眼深度推定、表面法線推定、マルチビュー再構成をサポート。
  • 専用ヘッドなし:タスク固有の予測ヘッドやデコーダーを必要としない。
  • 大規模なコーパス:5000万件の例を含むSenseNova-Vision Corpus。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト