hysts/pytorch_mpiigaze_demo
Gaze estimation using MPIIGaze and MPIIFaceGaze
解決する課題
このプロジェクトは、視線推定のデモプログラムを提供し、ユーザーが画像やビデオフィード(ライブウェカム入力を含む)に基づいて、人がどこを見ているかを判断できるようにします。MPIIGaze、MPIIFaceGaze、および ETH-XGaze のような学習済み視線推定モデルの使用を簡素化します。
仕組み
このプログラムは、ディープラーニングモデルを使用して視覚データを分析します。まず、選択した検出器(MediaPipe や dlib など)を使用して顔とランドマークを検出します。次に、特定の視線推定モデルを適用して視線ベクトルを予測します。システムは、複雑なデータの正規化を行い、確立された研究慣例に従って、入力画像と頭部姿勢がモデル用に正しくフォーマットされるようにします。
対象者
このツールは、人間とコンピュータの相互作用、コンピュータビジョン、および視線追跡アプリケーションに関心のある開発者や研究者向けに設計されています。
ハイライト
マルチモデルサポート: MPIIGaze、MPIIFaceGaze、および ETH-XGaze モデルをサポートしています。
柔軟な入力: 静止画、ビデオファイル、またはライブウェカムストリームで動作します。
カスタマイズ可能な検出: MediaPipe、dlib、および face_alignment_sfd を含む複数の顔検出オプションを提供します。
学習済み重み: Hugging Face Hub から safetensors 形式で重みを自動的にダウンロードします。
可視化ツール: 処理中にランドマーク、頭部姿勢、およびバウンディングボックスの表示を切り替えるためのインタラクティブなキーが含まれています。