Pointcept/Utonia

[ICML'26] Official repository of Utonia: Toward One Encoder for All Point Clouds

何を解決するか

Utonia は、3D点群用のクロスドメイン事前学習エンコーダーを提供し、屋内、屋外、オブジェクトレベルのデータなど、さまざまなドメインにおけるさまざまな下流3Dタスクに適用可能な単一のユニバーサルエンコーダーを構築することを目指しています。専用モデルを別々に用意する必要がありません。

動作方法

Point Transformer V3 (PTv3) アーキテクチャに基づき、Sonata および Concerto フレームワークから変更されています。モデルはエンコーダーのみのシステムとして動作し、3D点群データ(座標、色、法線)を入力として受け取り、階層的な符号化特徴を出力します。これらの特徴は、元の点群スケールに戻して、セマンティックセグメンテーションや可視化などのタスクに使用できます。

対象ユーザー

3Dコンピュータビジョンに取り組む研究者や開発者。特に、点群分析、セマンティックセグメンテーション、3Dシーン理解に高品質な事前学習表現が必要な方々。

特徴

  • クロスドメイン対応: 屋内、屋外、オブジェクトなど、多様な3Dデータセットで動作するように設計されています。
  • 推論デモ: PCA可視化、類似度ヒートマップ、セマンティックセグメンテーション用の即時利用可能なスクリプトを含みます。
  • 柔軟な統合: すぐにテストできるスタンドアロンモードと、既存のコードベースへの統合に適したパッケージモードの両方を提供します。
  • 動画対応: VGGT と組み合わせて、動画から抽出された点群を処理するのに使用できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト