FeyNoBg 與 NoBg: SOTA 背景移除模型與訓練庫
FeyNoBg 與 NoBg: SOTA 背景移除模型與訓練庫
FeyNoBg 在八個背景移除基準測試中達到 SOTA 性能
FeyNoBg 是一個用於自動背景移除的最先進模型,在八個主要基準測試中的四個中領先,並在剩餘的四個中與領先者的差距控制在 2% 以內。它專門設計用於處理低對比度、擁擠場景、偽裝以及高解析度圖像(包括 4K 和 8K 場景)等複雜情境。
性能指標
性能是使用 S-measure 來測量的,它評估預測前景遮罩與正確遮罩的準確度,同時獎勵完整的主體和忠實的形狀。FeyNoBg 在 UHRSD-TE 基準測試上展現了優異的結果,達到 0.981 分,而 BiRefNet 的得分為 0.957。
架構改進:擴展 BiRefNet
FeyNoBg 建構在 BiRefNet 架構之上,該架構利用定位模組來尋找前景,並利用重建模組來追蹤主體的邊界。開發者將特徵提取器的第三階段識別為平衡整體主體推理與空間細節的最關鍵部分。
為了在不遺失現有知識的情況下提升模型保留資訊的能力,團隊將第三階段從 18 個區塊擴展到 24 個。這使總參數數量從 222M 增加到 263M。透過保留相容的預訓練權重,並僅將六個新區塊初始化為未訓練狀態,模型能夠學習新技能而不遺忘基礎模型的能力。
克服專業化
僅使用 MaskFactory 資料集進行的初始訓練導致模型在 CAMO 基準測試上有所提升,但在 DIS5K 基準測試上出現回退。為防止模型在單一領域過度專業化,Feyn 採取了以下策略:
- 多樣化資料集組裝:團隊從 10 個不同的資料集中組裝了 26.1K 張圖像,涵蓋肖像、動漫、偽裝和擁擠場景。
- 限制來源大小:為防止單一大型資料集主導訓練過程,每個來源的圖像數量被限制為 4,000 張。
- 標準化註解:將分割遮罩和 alpha 遮罩都轉換為二進位前景遮罩,以確保在所有資料來源上有一致的訓練目標。
這種多樣化的方法成功地扭轉了 DIS5K 的回退,使其成為領先基準測試的結果。
NoBg 庫:統一的抠圖框架
為了解決圖像抠圖倉庫的碎片化問題,Feyn 發布了 NoBg,這是一個開源的 Python 庫,提供了一致的介面來運行和訓練背景移除模型。
性能與整合
NoBg 設計為高吞吐量和低延遲。與原始 BiRefNet 實作相比,NoBg 在批次大小為 1、2 和 4 的情況下展現了較低的峰值 GPU 記憶體使用量和較高的吞吐量。
該庫與 Hugging Face Trainer 整合,以實現精簡的訓練迴圈、檢查點和評估。它在推論前處理必要的圖像調整和標準化,並將模型輸出轉換為原始圖像大小的 alpha 遮罩,以產生透明的 PNG 輸出。
社區見解與考量
在 Hacker News 的社區討論中凸顯了背景移除作為核心系統任務的實用性,其重要性可與語音轉文字相媲美。然而,一些用戶對授權和實際應用提出了疑問:
為何要擴展採用 MIT 授權的模型權重(BiRefNet)並以 cc-by-nc-4.0 授權發布?
其他用戶指出「主體」定義的實際挑戰——例如,坐在沙發上的人應該被提取為僅此人,還是此人和沙發——並質疑該模型與專有工具(如 Adobe 的「Select Subject」和「Select Person」功能)相比如何。
可用性
- Model: 可在 Hugging Face 上獲得 (
feyninc/FeyNobg). - Library: 可透過
pip install nobg獲得,或在 GitHub 上取得 (feyninc/nobg). - Demo: 可作為 Hugging Face Space 使用。