hustvl/Moebius
[ECCV 2026] Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance
解决的问题
Moebius 解决了 AI 图像修复领域中"唯规模论"的趋势,即高质量结果通常需要庞大的基础模型(100亿+ 参数),计算成本高且速度慢。它提供了一种轻量级替代方案,在大幅减少参数量和推理时间的同时,仍保持工业级质量,使高质量修复在消费级和边缘设备上成为可能。
工作原理
Moebius 通过架构创新与知识蒸馏相结合,实现高效性能:
- LΙMI Block:一种自定义架构,通过将空间上下文和全局语义先验压缩为固定大小的线性矩阵,重构自注意力与交叉注意力机制,消除了注意力机制通常带来的二次计算开销。
- 自适应多粒度蒸馏:模型以"学生"身份训练,从更大的"教师"模型(PixelHacker)中学习。监督信号在多个层级(从微观中间特征到宏观扩散轨迹)进行对齐,严格在潜在空间内完成,避免昂贵的像素空间解码。
- 协同平衡机制:框架优化紧凑模型结构与蒸馏过程之间的关系,确保学生模型能吸收最大化的语义推理能力,同时不触及性能天花板。
适用人群
Moebius 专为需要高性能图像修复和 AI 物体移除,但受限于硬件资源或需在边缘设备上实现实时推理的开发者和研究人员设计。
核心亮点
- 极致高效:仅使用 0.22B 参数,不足 FLUX.1-Fill-Dev 等模型大小的 2%。
- 高速推理:实现超过 15 倍的推理加速,单步延迟约为 26ms。
- 媲美顶尖水平:在自然场景与人像场景的六个基准测试中,性能与或优于 100 亿级 SOTA 模型。
- 专注修复任务:专为图像修复优化,而非臃肿的通用模型。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目