hustvl/Moebius

[ECCV 2026] Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance

解決的問題

Moebius 解決了 AI 圖像修復領域中「唯規模論」的趨勢,即高品質結果通常需要龐大的基礎模型(100 億+ 參數),計算成本高且速度慢。它提供了一種輕量級替代方案,在大幅減少參數量和推論時間的同時,仍保持工業級品質,使高品質修復在消費級與邊緣設備上成為可能。

工作原理

Moebius 透過架構創新與知識蒸餾結合,實現高效性能:

  • LΙMI Block:一種自訂架構,透過將空間上下文與全域語意先驗壓縮為固定大小的線性矩陣,重構自注意力與交叉注意力機制,消除注意力機制通常帶來的二次計算開銷。
  • 自適應多粒度蒸餾:模型以「學生」身分訓練,從更大的「教師」模型(PixelHacker)中學習。監督訊號在多個層級(從微觀中間特徵到巨觀擴散軌跡)進行對齊,嚴格在潛在空間內完成,避免昂貴的像素空間解碼。
  • 協同平衡機制:框架優化緊湊模型結構與蒸餾過程之間的關係,確保學生模型能吸收最大化的語意推理能力,同時不觸及性能天花板。

適用對象

Moebius 專為需要高性能量圖像修復與 AI 物件移除,但受限於硬體資源或需在邊緣設備上實現即時推論的開發者與研究人員設計。

核心亮點

  • 極致高效:僅使用 0.22B 參數,不足 FLUX.1-Fill-Dev 等模型大小的 2%。
  • 高速推論:實現超過 15 倍的推論加速,單步延遲約為 26ms。
  • 媲美頂尖水準:在自然場景與人像場景的六個基準測試中,性能與或優於 100 億級 SOTA 模型。
  • 專注修復任務:專為圖像修復優化,而非臃腫的通用模型。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案