OschAI/VisioFirm
VisioFirm: Cross-Platform AI-assisted Annotation Tool for Computer Vision
解决的问题
VisioFirm 是一个基于 AI 的图像和视频标注工具,可显著减少计算机视觉数据集标注所需的手动工作量。它通过提供多种任务的半自动化预标注,消除了从零开始标注的需要,大幅加速了研究人员和机器学习工程师的工作流程。
工作原理
该工具提供一个基于浏览器的交互式画布,用户可在其中优化 AI 生成的标签。它集成了多种前沿模型,以自动化初始标注阶段:
- 检测与定位:使用 YOLO(v5-v12)、Grounding DINO(通过文本提示实现零样本检测)以及 YOLOv8-world 实现开放词汇预标注。
- 分割:采用 SAM2 实现精确分割和点击分割功能。
- 分类:使用 OpenAI CLIP 提供图像类别建议。
- 视频追踪:"SmartPropagator" 使用 SAM2 在帧之间传播标签,其他选项包括 OpenCV 跟踪器和线性插值。
- 跨域工作流:用户可从检测模型生成分割掩码,或从分割模型生成边界框。
适用人群
专为需要创建高质量标注数据集以训练计算机视觉模型(如 YOLO 或 SAM)的研究人员、数据科学家和机器学习工程师设计。
主要亮点
- 多任务支持:支持分类、轴对齐边界框、方向边界框(OBB)和多边形分割。
- AI 驱动的高效性:利用 SAM2、YOLO 和 Grounding DINO,可节省高达 80% 的手动工作量。
- 视频标注功能:支持使用 SAM2 和多种 OpenCV 跟踪器实现帧间标签传播。
- 灵活导出:支持以 YOLO、COCO 和自定义格式导出标注结果。
- 集成能力:提供 Python API 用于流程集成,并支持云/SSH 图像下载。
相关
- 项目
- 项目
- 项目
- 项目