FeyNoBg와 NoBg: SOTA 배경 제거 모델 및 학습 라이브러리
FeyNoBg와 NoBg: SOTA 배경 제거 모델 및 학습 라이브러리
FeyNoBg가 8개의 배경 제거 벤치마크에서 SOTA 성능을 달성
FeyNoBg는 자동 배경 제거를 위한 최첨단 모델로, 8개의 주요 벤치마크 중 4개에서 1위를 차지하고 나머지 4개에서는 리더와 2% 이내의 격차를 유지합니다. 저대비, 복잡한 군중 장면, 위장, 고해상도 이미지(4K 및 8K 장면 포함)와 같은 복잡한 상황을 처리하도록 특별히 설계되었습니다.
성능 지표
성능은 S-measure를 사용해 측정되며, 이는 예측된 전경 마스크와 정답 마스크의 정확도를 평가하여 전체 객체와 정확한 형태 모두를 보상합니다. FeyNoBg는 UHRSD-TE 벤치마크에서 0.981이라는 점수를 기록했으며, 이는 BiRefNet의 0.957보다 우수합니다.
아키텍처 개선: BiRefNet 확장
FeyNoBg는 BiRefNet 아키텍처를 기반으로 하며, 전경을 찾는 로컬라이제이션 모듈과 객체 경계를 추적하는 재구성 모듈을 사용합니다. 개발자들은 특징 추출기의 세 번째 단계가 전체 객체 추론과 공간 디테일의 균형을 맞추는 데 가장 중요하다고 판단했습니다.
모델이 기존 지식을 잃지 않으면서 정보를 보유할 수 있는 용량을 늘리기 위해 팀은 세 번째 단계를 18개 블록에서 24개 블록으로 확장했습니다. 이로 인해 전체 파라미터 수가 222M에서 263M으로 증가했습니다. 호환 가능한 사전 학습 가중치를 유지하고 새로 추가된 6개 블록만 미학습 상태로 초기화함으로써, 모델은 기본 모델의 역량을 잊지 않으면서 새로운 기술을 학습할 수 있었습니다.
학습 전략 및 데이터 다양성
효과적인 배경 제거는 전경 인식(대상을 배경에서 분리)과 이미지 매팅(머리카락이나 털과 같은 정밀한 경계 추적)의 조합을 필요로 합니다.
전문화 극복
MaskFactory 데이터셋만을 사용한 초기 학습에서는 모델이 CAMO 벤치마크에서는 향상되었지만 DIS5K 벤치마크에서는 성능이 감소했습니다. 모델이 특정 영역에 과도하게 전문화되는 것을 방지하기 위해 Feyn은 다음 전략을 구현했습니다:
- Diverse Dataset Assembly: 팀은 초상화, 애니메이션, 위장, 복잡한 장면 등을 포함하는 10개의 서로 다른 데이터셋에서 총 26.1K 이미지를 수집했습니다.
- Capping Source Size: 단일 대규모 데이터셋이 학습 과정을 지배하지 않도록 각 소스는 최대 4,000 이미지로 제한되었습니다.
- Standardized Annotations: 세분화 마스크와 알파 매트를 모두 이진 전경 마스크로 변환하여 모든 데이터 소스에서 일관된 학습 목표를 보장했습니다.
이와 같은 다양화된 접근 방식은 DIS5K 성능 저하를 성공적으로 되돌려, 벤치마크 선두 결과로 전환시켰습니다.
NoBg 라이브러리: 매팅을 위한 통합 프레임워크
이미지 매팅 저장소의 파편화를 해결하기 위해 Feyn은 NoBg를 공개했으며, 이는 배경 제거 모델을 실행하고 학습하기 위한 일관된 인터페이스를 제공하는 오픈소스 Python 라이브러리입니다.
성능 및 통합
NoBg는 높은 처리량과 낮은 지연 시간을 목표로 설계되었습니다. 원래 BiRefNet 구현과 비교했을 때, NoBg는 배치 크기 1, 2, 4에서 GPU 피크 메모리 사용량이 낮고 처리량이 더 높았습니다.
이 라이브러리는 Hugging Face Trainer와 통합되어 학습 루프, 체크포인트 저장 및 평가를 간소화합니다. 추론 전에 필요한 이미지 리사이징 및 정규화를 수행하고, 모델 출력물을 원본 이미지 크기의 알파 매트로 변환하여 투명 PNG 출력을 제공합니다.
커뮤니티 인사이트 및 고려사항
Hacker News에서의 커뮤니티 토론은 배경 제거가 음성‑텍스트 변환과 동등하게 핵심 시스템 작업으로서의 유용성을 강조했습니다. 그러나 일부 사용자는 라이선스와 실용적인 적용에 대한 질문을 제기했습니다:
왜 MIT 라이선스 모델의 가중치(BiRefNet)를 확장하고 cc-by-nc-4.0 라이선스로 배포하나요?
다른 사용자들은 "대상" 정의의 실질적인 어려움을 지적했습니다—예를 들어, 소파에 앉아 있는 사람을 사람만 추출할지, 사람과 소파를 모두 추출할지에 대한 문제—그리고 모델이 Adobe의 "Select Subject" 및 "Select Person" 기능과 같은 상용 도구와 어떻게 비교되는지에 대해 질문했습니다.
사용 가능성
- Model: Hugging Face에서 제공 (
feyninc/FeyNobg). - Library:
pip install nobg를 통해 또는 GitHub(feyninc/nobg)에서 제공. - Demo: Hugging Face Space에서 제공.
SUMMARY: Feyn은 8개 카테고리에서 선도적인 벤치마크를 능가하거나 동등한 성능을 보이는 최첨단 배경 제거 모델인 FeyNoBg와, 이러한 모델을 학습하고 실행하기 위한 오픈소스 Python 라이브러리인 NoBg를 소개합니다.
TITLE: FeyNoBg와 NoBg: SOTA 배경 제거 모델 및 학습 라이브러리