jeremyipark/vision-demos
Fun real-world computer vision demos!
vision‑demos – 実世界のコンピュータビジョンデモ
概要 – 最新の姿勢推定モデルとセグメンテーションモデルを日常の活動に適用する方法を紹介する、すぐに実行できるデモアプリケーションの小さなコレクションです。各デモは、専用のREADME、インストール手順、短い動画風のイラストレーションを含む独自のサブフォルダに配置されています。
| デモ | 機能 | 主要モデル |
|---|---|---|
| dance_sync | 同じ振付の2つの動画を取得し、推定された体の姿勢を重ね合わせ、ダンサーがどれだけ同期しているかを定量化する数値類似度スコアを生成します。 | vitpose-plus-large |
| chin_ups | チンアップをしている人のクリップを分析し、反復回数をカウントし、各反復の上昇と下降のフェーズにタイムスタンプを付けます。 | vitpose-plus-large |
| rock_climbing | ボウルダーウォールを個々のホールドにセグメント化し、クライマーがどのホールドをどのような順序で使用したかを特定し、同じルートの複数の試行を比較します。 | sam3.1 (セグメンテーション) + vitpose-plus-large (姿勢) |
| running | ランナーのカデンスを測定し、各足着地(フットストライク)にタイムスタンプを付け、接地時の平均膝形状プロファイルを計算します。 | vitpose-plus-large |
仕組み
- 姿勢推定は
vitpose-plus-largeモデル(Vision-Transformerベースの人間姿勢検出器)によって実行されます。このモデルは各フレームの2D関節座標を返し、デモはこれを使用してタイミング、類似度、またはバイオメカニカル指標を計算します。 - クライミングデモのセグメンテーションは、壁の上の個々のクライミングホールドを分離するためにMetaの
sam3.1(Segment Anything Model) に依存しています。 - シンプルなPythonスクリプトがモデルの出力を組み合わせ、元の動画に可視化を重ね合わせ、サムネイルパネルに表示される数値サマリーを生成します。
始め方
- リポジトリをクローンします。
- 興味のあるサブディレクトリのデモごとのREADMEに従います(例:
dance_sync/README.md)。 - 記載されたPythonの依存関係をインストールします(通常は
torch、opencv-python、およびVLMモデルクライアントライブラリ)。 - 提供されたリンクを介して必要なモデルの重みをダウンロードします(READMEはVLMモデルハブを指しています)。
- 独自の動画ファイルでデモスクリプトを実行します。
対象読者
- スポーツ、ダンス、または運動科学における姿勢ベースの分析の迅速で具体的な例を求めている研究者や趣味の愛好家。
- 同じモデルを軸にカスタム分析パイプラインを構築するためのテンプレートを探している開発者。
ライセンス
Apache‑2.0 – 出典を明記すれば、商用および非商用利用が可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト