zju3dv/EfficientLoFTR

EfficientLoFTRは、スパースマッチング手法に匹敵する速度で高品質な画像対応付けを提供する半密な局所特徴量マッチングシステムです。

zju3dv/neuralbody

Neural Bodyは、構造化された潜在コードを用いた暗黙的ニューラルフィールドを学習し、マルチビュービデオから動的な人体をモデル化およびレンダリングするための研究用コードベースです。ZJU‑MoCapおよびPeople‑Snapshotでの学習、新規視点のレンダリング、ポーズの一般化、メッシュ抽出をサポートしており、Docker、分散学習、および事前学習済みモデルも提供しています。

zju3dv/animatable_nerf

NeRFやSDFなどの暗黙的ニューラル表現を使用して、ビデオから現実的でアニメーション可能な3D人間アバターを作成するためのフレームワーク。

guojiajeremy/Dinomaly

統一された複数クラスモデルと単一クラス専門モデルの間の性能ギャップを埋める、最小限のTransformerベースのフレームワーク。

greyovo/PicQuery

MobileCLIP2 を使用して、ローカルの写真に対して自然言語の記述または画像クエリによる、プライベートでデバイス内での意味検索を可能にする Android アプリ

zju3dv/Scal3R

Scal3Rは、テスト時学習を用いて画像セットからカメラポーズ、深度マップ、点群を生成するスケーラブルな3D再構成フレームワークです。

zju3dv/Murre

SfMガイド付き単眼深度推定とTSDF融合を組み合わせた、画像から正確な高密度3Dモデルを生成するマルチビュー3D再構成フレームワークです。

google-deepmind/representations4d

Google DeepMindの4D表現に関する研究プロジェクトのコレクション。深度推定やオブジェクト追跡などの空間的・時間的タスクに向けた自己教師学習型動画および視覚モデルを提供する。

davidpagnon/Sports2D

1つの動画またはWebカメラから関節軌道と角度を自動計算する2次元モーションキャプチャおよびバイオメカニクス解析ツール。

NVlabs/AutoGaze

AutoGaze は、視覚変換器およびマルチモーダル LLM に対して冗長なビデオパッチを削減する自己回帰的な注視モデルであり、高解像度の長時間ビデオの効率的な処理を可能にします。NVILabs が、学習済みモデル、学習データ、ベンチマーク、統合例を含めて公開しています。