MultiMatte 2026 背景移除模型透過可提示的 Matte 提升 SAM 3 分割效能
MultiMatte 將可提示的 alpha-matte 加入 SAM 3,並在所有基準分割上表現優於 SAM 3
MultiMatte 由 Feyn 發布,僅以 LoRA adapter 修改 SAM 3 的 860M 參數中的 2.27 %,卻在 DIS‑VD 基準上達成 0.901 的 S‑measure,遠高於 SAM 3 的 0.667。此提升顯示,微小的低秩更新即可將二元分割器轉化為高品質的 matte 生成器,同時保留原始的文字提示對齊能力。
可提示的 matte 解決二元遮罩的模糊邊界問題
SAM 3 對文字提示描述的物件回傳二元遮罩,無法呈現半透明或細緻結構(如頭髮)。MultiMatte 將二元輸出改為 alpha matte,為每個像素分配連續的不透明度值,進而能精確提取模糊邊界。在五個高解析度的 DIS 分割上,SAM 3 的 S‑measure 為 0.649 至 0.703,而 MultiMatte 則達到 0.893 至 0.923。
低秩微調(LoRA)保留 SAM 3 的文字對齊能力
MultiMatte 使用參數高效微調(PEFT)技術,以 LoRA(秩-16 adapter)在每座塔的注意力與 MLP 投影層上進行訓練,包含 CLIP 文字塔。每個目標線性層保持預訓練權重凍結,同時學習兩個小型矩陣,以添加低秩更新。這些 adapter 已合併至釋出權重中,因此推理時無需額外套件。
訓練資料與目標
- 影像: 19,953 張多樣化影像(顯著物件、偽裝、頭髮、海洋場景)。
- 步數: 14,000 個訓練步數。
- 損失函數: Focal loss + Dice loss,與 SAM 3 使用的語意分割目標相同。
- 提示監督: 4,949 張影像(佔總集的 24.8 %)包含人類撰寫的標籤,命名目標物件,使新 matte head 學習使用 SAM 3 的既有文字對齊。
基準結果顯示持續提升
| 分割 | SAM 3 | MultiMatte | Δ S‑measure |
|---|---|---|---|
| DIS‑VD | 0.667 | 0.901 | +0.233 |
| DIS‑TE1 | 0.667 | 0.901 | +0.234 |
| DIS‑TE2 | 0.703 | 0.923 | +0.220 |
| DIS‑TE3 | 0.685 | 0.921 | +0.235 |
| DIS‑TE4 | 0.649 | 0.893 | +0.244 |
| DAVIS‑S(無訓練同級) | 0.913 | 0.979 | +0.066 |
| DUT‑OMRON(無訓練同級) | 0.792 | 0.901 | +0.109 |
所有分割皆有改善;在訓練混合中無同級資料集的資料集上,絕對提升最大,顯示強大的泛化能力。S‑measure 變化小於 0.002 被視為測量雜訊。
即使微調後,提示引導仍具價值
即使經過 LoRA 適應,提供概念名稱仍可提升效能。在 DIS‑VD 上,真實概念名稱可為 SAM 3 增加 0.150 的 S‑measure,且無需任何梯度步數,對 MultiMatte 仍貢獻 0.036,確認提示路徑在重訓練後依然有效。
使用 NoBg 庫輕鬆推理
MultiMatte 透過 nobg Python 套件發行。LoRA adapter 已合併,可直接使用:
from nobg import AutoModel, AutoProcessor
model = AutoModel.from_pretrained("feyninc/multimatte")
processor = AutoProcessor.from_pretrained("feyninc/multimatte")
# 預設提示(無概念名稱)
cutout = model.predict(processor, "photo.jpg")
cutout.save("output.png")
# 提示式移除(保留「the dog」)
cutout = model.predict(processor, "photo.jpg", "the dog")
predict 回傳 RGBA 切剪圖;設定 return_type="tensor" 可取得原始 matte。
社群反饋突顯實際應用的穩健性
"我試了張大多數背景移除工具都失敗的圖片——一匹馬和柵欄顏色相近——MultiMatte 完美完成!" – zurtri
"這個展示是客戶端執行嗎?它完全符合我目前使用 Preview.app → Tools → Remove Background 的工作流程。" – peterldowns
"時機完美,因為 remove.bg 正被整合進 Canva;這看起來太棒了!" – FlamingMoe
這些評論證實 MultiMatte 能處理挑戰性的色彩相似前景/背景案例,且使用者欣賞其易於整合的特性。
參考文獻
- Meta. SAM 3: Segment Anything with Concepts. arXiv:2511.16719, 2025.
- Hu et al. LoRA: Low‑Rank Adaptation of Large Language Models. arXiv:2106.09685, 2021.
- Thinking Machines Lab. LoRA Without Regret. 2025. https://thinkingmachines.ai/blog/lora/
- Lin et al. Focal Loss for Dense Object Detection. arXiv:1708.02002, 2017.
- Sargsyan & Navasardyan. FlowDIS: Language‑Guided Dichotomous Image Segmentation with Flow Matching. CVPR 2026. arXiv:2605.05077.
Sources
相關
- 專案
- Dispatch
- Dispatch
- Dispatch
- Dispatch