MultiMatte 2026 背景移除模型透過可提示的 Matte 提升 SAM 3 分割效能

MultiMatte 將可提示的 alpha-matte 加入 SAM 3,並在所有基準分割上表現優於 SAM 3

MultiMatte 由 Feyn 發布,僅以 LoRA adapter 修改 SAM 3 的 860M 參數中的 2.27 %,卻在 DIS‑VD 基準上達成 0.901 的 S‑measure,遠高於 SAM 3 的 0.667。此提升顯示,微小的低秩更新即可將二元分割器轉化為高品質的 matte 生成器,同時保留原始的文字提示對齊能力。


可提示的 matte 解決二元遮罩的模糊邊界問題

SAM 3 對文字提示描述的物件回傳二元遮罩,無法呈現半透明或細緻結構(如頭髮)。MultiMatte 將二元輸出改為 alpha matte,為每個像素分配連續的不透明度值,進而能精確提取模糊邊界。在五個高解析度的 DIS 分割上,SAM 3 的 S‑measure 為 0.649 至 0.703,而 MultiMatte 則達到 0.893 至 0.923。


低秩微調(LoRA)保留 SAM 3 的文字對齊能力

MultiMatte 使用參數高效微調(PEFT)技術,以 LoRA(秩-16 adapter)在每座塔的注意力與 MLP 投影層上進行訓練,包含 CLIP 文字塔。每個目標線性層保持預訓練權重凍結,同時學習兩個小型矩陣,以添加低秩更新。這些 adapter 已合併至釋出權重中,因此推理時無需額外套件。


訓練資料與目標

  • 影像: 19,953 張多樣化影像(顯著物件、偽裝、頭髮、海洋場景)。
  • 步數: 14,000 個訓練步數。
  • 損失函數: Focal loss + Dice loss,與 SAM 3 使用的語意分割目標相同。
  • 提示監督: 4,949 張影像(佔總集的 24.8 %)包含人類撰寫的標籤,命名目標物件,使新 matte head 學習使用 SAM 3 的既有文字對齊。

基準結果顯示持續提升

分割 SAM 3 MultiMatte Δ S‑measure
DIS‑VD 0.667 0.901 +0.233
DIS‑TE1 0.667 0.901 +0.234
DIS‑TE2 0.703 0.923 +0.220
DIS‑TE3 0.685 0.921 +0.235
DIS‑TE4 0.649 0.893 +0.244
DAVIS‑S(無訓練同級) 0.913 0.979 +0.066
DUT‑OMRON(無訓練同級) 0.792 0.901 +0.109

所有分割皆有改善;在訓練混合中無同級資料集的資料集上,絕對提升最大,顯示強大的泛化能力。S‑measure 變化小於 0.002 被視為測量雜訊。


即使微調後,提示引導仍具價值

即使經過 LoRA 適應,提供概念名稱仍可提升效能。在 DIS‑VD 上,真實概念名稱可為 SAM 3 增加 0.150 的 S‑measure,且無需任何梯度步數,對 MultiMatte 仍貢獻 0.036,確認提示路徑在重訓練後依然有效。


使用 NoBg 庫輕鬆推理

MultiMatte 透過 nobg Python 套件發行。LoRA adapter 已合併,可直接使用:

from nobg import AutoModel, AutoProcessor

model = AutoModel.from_pretrained("feyninc/multimatte")
processor = AutoProcessor.from_pretrained("feyninc/multimatte")

# 預設提示(無概念名稱)
cutout = model.predict(processor, "photo.jpg")
cutout.save("output.png")

# 提示式移除(保留「the dog」)
cutout = model.predict(processor, "photo.jpg", "the dog")

predict 回傳 RGBA 切剪圖;設定 return_type="tensor" 可取得原始 matte。


社群反饋突顯實際應用的穩健性

"我試了張大多數背景移除工具都失敗的圖片——一匹馬和柵欄顏色相近——MultiMatte 完美完成!" – zurtri

"這個展示是客戶端執行嗎?它完全符合我目前使用 Preview.app → Tools → Remove Background 的工作流程。" – peterldowns

"時機完美,因為 remove.bg 正被整合進 Canva;這看起來太棒了!" – FlamingMoe

這些評論證實 MultiMatte 能處理挑戰性的色彩相似前景/背景案例,且使用者欣賞其易於整合的特性。


參考文獻

  1. Meta. SAM 3: Segment Anything with Concepts. arXiv:2511.16719, 2025.
  2. Hu et al. LoRA: Low‑Rank Adaptation of Large Language Models. arXiv:2106.09685, 2021.
  3. Thinking Machines Lab. LoRA Without Regret. 2025. https://thinkingmachines.ai/blog/lora/
  4. Lin et al. Focal Loss for Dense Object Detection. arXiv:1708.02002, 2017.
  5. Sargsyan & Navasardyan. FlowDIS: Language‑Guided Dichotomous Image Segmentation with Flow Matching. CVPR 2026. arXiv:2605.05077.

Sources

相關

  • 專案
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch