OschAI/VisioFirm

VisioFirm: Cross-Platform AI-assisted Annotation Tool for Computer Vision

해결하는 문제

VisioFirm은 컴퓨터 비전용 데이터셋 레이블링에 필요한 수작업을 줄이는 AI 기반 이미지 및 비디오 주석 도구입니다. 완전히 처음부터 시작할 필요 없이 다양한 작업에 대해 반자동 사전 레이블링을 제공함으로써 연구자와 ML 엔지니어의 작업 속도를 크게 향상시킵니다.

작동 방식

이 도구는 사용자가 AI가 생성한 레이블을 보정할 수 있는 브라우저 기반 인터랙티브 캔버스를 제공합니다. 최신 기술 모델들을 통합하여 초기 레이블링 단계를 자동화합니다:

  • 검출 및 지정: YOLO (v5-v12), Grounding DINO (텍스트 프롬프트를 통한 제로샷 검출용), YOLOv8-world (오픈 뷰포인트 사전 레이블링용) 사용.
  • 세그멘테이션: SAM2를 사용하여 정밀한 세그멘테이션과 클릭 기반 세그멘테이션 기능 제공.
  • 분류: OpenAI CLIP을 사용하여 이미지 클래스 제안.
  • 비디오 추적: "SmartPropagator"는 SAM2를 사용해 프레임 간 레이블을 전파하며, 다른 옵션으로는 OpenCV 트래커와 선형 보간이 포함됨.
  • 크로스 도메인 워크플로우: 검출 모델에서 세그멘테이션 마스크를 생성하거나, 세그멘테이션 모델에서 경계 박스를 생성할 수 있음.

대상 사용자

YOLO나 SAM과 같은 컴퓨터 비전 모델을 훈련시키기 위해 고품질의 주석 데이터셋을 생성해야 하는 연구자, 데이터 과학자, 머신러닝 엔지니어를 위한 도구입니다.

주요 특징

  • 다중 작업 지원: 분류, 축 평행 경계 박스, 방향성 경계 박스(OBB), 다각형 세그멘테이션을 지원.
  • AI 기반 속도 향상: SAM2, YOLO, Grounding DINO를 활용해 수작업을 최대 80% 절감 가능.
  • 비디오 주석: SAM2와 다양한 OpenCV 트래커를 사용한 프레임 간 레이블 전파 기능.
  • 유연한 내보내기: YOLO, COCO, 사용자 정의 형식으로 주석 내보내기 지원.
  • 통합 기능: 파이썬 API를 포함하여 파이프라인 통합 가능하며, 클라우드/SSH 이미지 다운로드도 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트