FeyNoBg と NoBg: SOTA 背景除去モデルとトレーニングライブラリ

FeyNoBg と NoBg: SOTA 背景除去モデルとトレーニングライブラリ

FeyNoBg は八つの背景除去ベンチマークで SOTA パフォーマンスを達成

FeyNoBg は自動背景除去のための最先端モデルで、八つの主要ベンチマークのうち四つでトップとなり、残りの四つではリーダーから 2% 以内に収まります。低コントラスト、混雑したシーン、カモフラージュ、および高解像度画像(4K や 8K シーンを含む)などの複雑なシナリオに対応するように特別に設計されています。

パフォーマンス指標

パフォーマンスは S-measure を使用して測定され、これは予測された前景マスクと正しいマスクの精度を評価し、完全な被写体と忠実な形状の両方に報酬を与えます。FeyNoBg は UHRSD-TE ベンチマークで優れた結果を示し、BiRefNet の 0.957 と比較して 0.981 のスコアを達成しました。

アーキテクチャの改善: BiRefNet の拡張

FeyNoBg は BiRefNet アーキテクチャに基づいて構築されており、局在化モジュールを使用して前景を見つけ、再構成モジュールを使用して被写体の境界を追跡します。開発者は、特徴抽出器の第三段階が全体の被写体推論と空間的詳細のバランスを取る上で最も重要であると特定しました。

既存の知識を失うことなく情報を保持する能力を高めるため、チームは特徴抽出器の第三段階を 18 ブロックから 24 ブロックに拡張しました。これにより、総パラメータ数は 222M から 263M に増加しました。互換性のある事前学習済みウェイトを保持し、新たに追加された六つのブロックのみを未訓練状態で初期化することにより、ベースモデルの能力を忘れることなく新しいスキルを学ぶことができました。

トレーニング戦略とデータの多様性

効果的な背景除去には、前景認識(被写体と背景の分離)と画像マッティング(髪や毛などの正確な境界を追跡)の組み合わせが必要です。

専門化の克服

MaskFactory データセットのみを使用した初期のトレーニングランは、CAMO ベンチマークでは改善したが DIS5K ベンチマークでは後退するモデルを導いた。モデルが特定の分野に過度に専門化するのを防ぐため、Feyn は以下の戦略を実施した:

  • 多様なデータセットの組み立て: チームは、ポートレート、アニメ、カモフラージュ、混雑したシーンをカバーする 10 の異なるデータセットから 26.1K 枚の画像を組み立てました。
  • ソースサイズの上限設定: 単一の大規模データセットがトレーニングプロセスを支配するのを防ぐため、各ソースを 4,000 枚の画像に上限設定しました。
  • アノテーションの標準化: セグメンテーションマスクとアルファマットの両方をバイナリ前景マスクに変換し、すべてのデータソース間で一貫したトレーニングターゲットを確保しました。

この多様化されたアプローチにより、DIS5K の後退が成功裏に逆転し、ベンチマークをリードする結果に変わりました。

NoBg ライブラリ: マッティングのための統一フレームワーク

画像マッティングリポジトリの断片化に対処するため、Feyn はオープンソースの Python ライブラリである NoBg をリリースしました。このライブラリは、背景除去モデルの実行とトレーニングのための一貫したインターフェースを提供します。

パフォーマンスと統合

NoBg は高スループットと低レイテンシーを目的として設計されています。元の BiRefNet 実装と比較すると、NoBg はバッチサイズ 1、2、4 においてピーク GPU メモリ使用量が低く、スループットが高いことを示しました。

このライブラリは、Hugging Face Trainer と統合され、トレーニングループ、チェックポイント、評価を合理化します。推論前に必要な画像のリサイズと正規化を処理し、モデルの出力を元の画像サイズのアルファマットに変換して透明 PNG 出力を行います。

コミュニティの洞察と考慮事項

Hacker News のコミュニティディスカッションでは、背景除去が音声認識と同等の重要性を持つコアシステムタスクであることが強調されました。ただし、一部のユーザーはライセンスと実用的な応用について疑問を呈しました:

MIT ライセンスのモデルのウェイト (BiRefNet) を拡張し、cc-by-nc-4.0 ライセンスでリリースする理由は何ですか?

その他のユーザーは、「被写体」の定義における実際的な課題について指摘しました。たとえば、ソファに座っている人物を人物のみとして抽出すべきか、人物とソファの両方として抽出すべきかという点です。また、Adobe の 「Select Subject」 と 「Select Person」 機能のような proprietary ツールとモデルがどのように比較されるかについても疑問を呈しました。

入手可能性

  • モデル: Hugging Face (feyninc/FeyNobg) で利用可能です。
  • ライブラリ: pip install nobg を介してまたは GitHub (feyninc/nobg) で利用可能です。
  • デモ: Hugging Face Space として利用可能です。

Sources