NVlabs/Fast-FoundationStereo
[CVPR 2026] Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching
解决的问题
Fast-FoundationStereo 解决了立体匹配中精度与速度之间的权衡问题。现有的立体视觉基础模型虽然具备强大的零样本泛化能力(无需重新训练即可在新数据上工作),但通常速度过慢,无法满足实时应用需求。相反,高效的架构往往缺乏鲁棒性,且需要昂贵的领域特定微调。本项目提供了一组架构,在保持高零样本精度的同时,能够以实时帧率运行。
工作原理
该项目采用“分而治之”的加速策略,包含三个核心技术组件:
- 知识蒸馏:将复杂的混合骨干网络压缩为单一高效的教师模型。
- 块级神经架构搜索(NAS):基于特定延迟预算自动寻找最佳成本过滤设计,以降低搜索复杂度。
- 结构化剪枝:移除迭代精炼模块中的冗余。
为支持训练,作者开发了一条自动伪标签流水线,从 Stereo4D 数据集收集了 140 万对真实场景下的立体图像对,以补充合成训练数据。
适用对象
本工具专为从事实时深度估计、机器人和计算机视觉应用的开发者与研究人员设计,无需领域特定微调即可实现高质量立体匹配。
主要亮点
- 实时性能:运行速度比原始 FoundationStereo 快 10 倍以上。
- 零样本泛化:无需额外训练即可在未见数据上保持强准确性。
- 灵活的权衡:提供多个检查点和配置标志(如
valid_iters和scale),可灵活平衡速度与精度。 - 部署就绪:支持导出为 ONNX 和 TensorRT(TRT),实现优化的 GPU 推理。
相关
- 项目
- 项目
- 项目
- 项目