hysts/pytorch_mpiigaze_demo
Gaze estimation using MPIIGaze and MPIIFaceGaze
解决的问题
该项目提供了一个注视点估计的演示程序,允许用户根据图像或视频流(包括实时网络摄像头输入)来确定人的注视位置。它简化了使用 MPIIGaze、MPIIFaceGaze 和 ETH-XGaze 等预训练注视点估计模型的过程。
工作原理
该程序使用深度学习模型来分析视觉数据。它首先使用选定的检测器(如 MediaPipe 或 dlib)检测人脸和关键点,然后应用特定的注视点估计模型来预测注视向量。该系统处理复杂的数据归一化,以确保输入图像和头部姿态按照既定的研究惯例进行正确格式化,以供模型使用。
适用人群
该工具是为对人机交互、计算机视觉和注视追踪应用感兴趣的开发者和研究人员设计的。
亮点
- 多模型支持: 支持 MPIIGaze、MPIIFaceGaze 和 ETH-XGaze 模型。
- 灵活的输入: 支持静态图像、视频文件或实时网络摄像头流。
- 可定制的检测: 提供多种人脸检测选项,包括 MediaPipe、dlib 和 face_alignment_sfd。
- 预训练权重: 自动从 Hugging Face Hub 以 safetensors 格式下载权重。
- 可视化工具: 包括交互式按键,可在处理过程中切换显示关键点、头部姿态和边界框。