Pointcept/Utonia
[ICML'26] Official repository of Utonia: Toward One Encoder for All Point Clouds
何を解決するか
Utonia は、3D点群用のクロスドメイン事前学習エンコーダーを提供し、屋内、屋外、オブジェクトレベルのデータなど、さまざまなドメインにおけるさまざまな下流3Dタスクに適用可能な単一のユニバーサルエンコーダーを構築することを目指しています。専用モデルを別々に用意する必要がありません。
動作方法
Point Transformer V3 (PTv3) アーキテクチャに基づき、Sonata および Concerto フレームワークから変更されています。モデルはエンコーダーのみのシステムとして動作し、3D点群データ(座標、色、法線)を入力として受け取り、階層的な符号化特徴を出力します。これらの特徴は、元の点群スケールに戻して、セマンティックセグメンテーションや可視化などのタスクに使用できます。
対象ユーザー
3Dコンピュータビジョンに取り組む研究者や開発者。特に、点群分析、セマンティックセグメンテーション、3Dシーン理解に高品質な事前学習表現が必要な方々。
特徴
- クロスドメイン対応: 屋内、屋外、オブジェクトなど、多様な3Dデータセットで動作するように設計されています。
- 推論デモ: PCA可視化、類似度ヒートマップ、セマンティックセグメンテーション用の即時利用可能なスクリプトを含みます。
- 柔軟な統合: すぐにテストできるスタンドアロンモードと、既存のコードベースへの統合に適したパッケージモードの両方を提供します。
- 動画対応: VGGT と組み合わせて、動画から抽出された点群を処理するのに使用できます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト