jeremyipark/vision-demos

Fun real-world computer vision demos!

vision‑demos – 现实世界计算机视觉演示

简介 – 一个小型的即插即用演示应用程序集合,展示了现代姿态估计和分割模型如何应用于日常活动。每个演示都位于其自己的子文件夹中,包含专门的 README、安装步骤和简短的视频风格插图。

演示 功能 核心模型
dance_sync 获取同一编舞的两个视频,叠加估计的身体姿态,并生成一个量化舞者同步程度的数值相似度分数。 vitpose-plus-large
chin_ups 分析某人做引体向上的视频片段,计算重复次数,并为每次重复的向上和向下阶段添加时间戳。 vitpose-plus-large
rock_climbing 将抱石墙分割成单独的岩点,识别攀岩者使用了哪些岩点及其顺序,并比较同一路线的多次尝试。 sam3.1 (分割) + vitpose-plus-large (姿态)
running 测量跑步者的步频,为每次触地添加时间戳,并计算接触时的平均膝关节形状轮廓。 vitpose-plus-large

工作原理

  • 姿态估计vitpose-plus-large 模型(基于 Vision-Transformer 的人体姿态检测器)执行。该模型返回每一帧的 2D 关节坐标,演示程序利用这些坐标计算计时、相似度或生物力学指标。
  • 攀岩演示中的分割依赖于 Meta 的 sam3.1 (Segment Anything Model) 来隔离墙上的单个攀岩岩点。
  • 简单的 Python 脚本将模型输出拼接在一起,在原始视频上叠加可视化效果,并生成缩略图面板中显示的数值摘要。

快速开始

  1. 克隆仓库。
  2. 遵循您感兴趣的子目录中的每个演示的 README(例如 dance_sync/README.md)。
  3. 安装列出的 Python 依赖项(通常是 torchopencv-python 和 VLM 模型客户端库)。
  4. 通过提供的链接下载所需的模型权重(README 指向 VLM 模型中心)。
  5. 在您自己的视频文件上运行演示脚本。

目标受众

  • 希望获得基于姿态的运动、舞蹈或运动科学分析快速具体示例的研究人员或爱好者。
  • 寻找围绕相同模型构建自定义分析管道模板的开发者。

许可证

Apache‑2.0 – 免费用于商业和非商业用途,需注明出处。

相关

  • 项目
  • 项目
  • 项目
  • 项目