levyflux/AViD
Framework that enables fine-tuning of vision-language grounding models on custom datasets
해결하는 문제
AViD는 오픈-보리ュ움 객체 탐지기인 Grounding DINO를 사용자 정의 데이터셋에서 미세 조정하기 위한 실용적인 워크플로우를 제공합니다. 모든 모델 파라미터를 업데이트하는 계산 비용 없이 대규모 탐지기를 도메인 특화 객체에 적응시킬 수 있습니다.
작동 방식
AViD는 LoRA(Low-Rank Adaptation)를 사용한 파라미터 효율적인 미세 조정(PEFT)을 구현하며, 탐지기의 어텐션, 프로젝션, FFN, 경계 상자, 특징 맵 레이어를 타겟으로 합니다. 학습 안정성을 위해 선택적 지수 이동 평균(EMA)을 포함합니다. 시스템은 CSV 기반의 데이터셋 리더를 사용하며, YAML 기반의 학습, 체크포인팅, mAP, 정밀도, 재현율과 같은 메트릭을 평가하는 전용 평가 루프를 포함하는 완전한 파이프라인을 제공합니다.
대상 사용자
특수한 객체에 대해 비전-언어 탐지기를 훈련해야 하지만 전체 파라미터 미세 조정을 피하고 싶은 개발자 및 AI 팀을 위한 것입니다.
주요 특징
- 파라미터 효율적인 적응: 특정 레이어에 초점을 맞춘 LoRA를 사용하여 빠르고 가벼운 학습을 가능하게 합니다.
- 엔드투엔드 워크플로우: 데이터셋 로딩, 학습, 검증, 평가를 하나의 리포지토리에서 통합합니다.
- 학습 안정화: 더 부드러운 모델 경로를 보장하기 위한 선택적 EMA 지원.
- 탐지 중심 평가: 클래스별 상세 요약 및 시각적 비교를 제공합니다.
- 유연한 진입점: YAML 구성, Gradio 데모, 단일 이미지 추론 스크립트를 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트