NVlabs/Fast-FoundationStereo

[CVPR 2026] Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching

解决的问题

Fast-FoundationStereo 解决了立体匹配中精度与速度之间的权衡问题。现有的立体视觉基础模型虽然具备强大的零样本泛化能力(无需重新训练即可在新数据上工作),但通常速度过慢,无法满足实时应用需求。相反,高效的架构往往缺乏鲁棒性,且需要昂贵的领域特定微调。本项目提供了一组架构,在保持高零样本精度的同时,能够以实时帧率运行。

工作原理

该项目采用“分而治之”的加速策略,包含三个核心技术组件:

  1. 知识蒸馏:将复杂的混合骨干网络压缩为单一高效的教师模型。
  2. 块级神经架构搜索(NAS):基于特定延迟预算自动寻找最佳成本过滤设计,以降低搜索复杂度。
  3. 结构化剪枝:移除迭代精炼模块中的冗余。

为支持训练,作者开发了一条自动伪标签流水线,从 Stereo4D 数据集收集了 140 万对真实场景下的立体图像对,以补充合成训练数据。

适用对象

本工具专为从事实时深度估计、机器人和计算机视觉应用的开发者与研究人员设计,无需领域特定微调即可实现高质量立体匹配。

主要亮点

  • 实时性能:运行速度比原始 FoundationStereo 快 10 倍以上。
  • 零样本泛化:无需额外训练即可在未见数据上保持强准确性。
  • 灵活的权衡:提供多个检查点和配置标志(如 valid_itersscale),可灵活平衡速度与精度。
  • 部署就绪:支持导出为 ONNX 和 TensorRT(TRT),实现优化的 GPU 推理。

相关

  • 项目
  • 项目
  • 项目
  • 项目