OschAI/VisioFirm

VisioFirm: Cross-Platform AI-assisted Annotation Tool for Computer Vision

解决的问题

VisioFirm 是一个基于 AI 的图像和视频标注工具,可显著减少计算机视觉数据集标注所需的手动工作量。它通过提供多种任务的半自动化预标注,消除了从零开始标注的需要,大幅加速了研究人员和机器学习工程师的工作流程。

工作原理

该工具提供一个基于浏览器的交互式画布,用户可在其中优化 AI 生成的标签。它集成了多种前沿模型,以自动化初始标注阶段:

  • 检测与定位:使用 YOLO(v5-v12)、Grounding DINO(通过文本提示实现零样本检测)以及 YOLOv8-world 实现开放词汇预标注。
  • 分割:采用 SAM2 实现精确分割和点击分割功能。
  • 分类:使用 OpenAI CLIP 提供图像类别建议。
  • 视频追踪:"SmartPropagator" 使用 SAM2 在帧之间传播标签,其他选项包括 OpenCV 跟踪器和线性插值。
  • 跨域工作流:用户可从检测模型生成分割掩码,或从分割模型生成边界框。

适用人群

专为需要创建高质量标注数据集以训练计算机视觉模型(如 YOLO 或 SAM)的研究人员、数据科学家和机器学习工程师设计。

主要亮点

  • 多任务支持:支持分类、轴对齐边界框、方向边界框(OBB)和多边形分割。
  • AI 驱动的高效性:利用 SAM2、YOLO 和 Grounding DINO,可节省高达 80% 的手动工作量。
  • 视频标注功能:支持使用 SAM2 和多种 OpenCV 跟踪器实现帧间标签传播。
  • 灵活导出:支持以 YOLO、COCO 和自定义格式导出标注结果。
  • 集成能力:提供 Python API 用于流程集成,并支持云/SSH 图像下载。

相关

  • 项目
  • 项目
  • 项目
  • 项目