NVlabs/Fast-FoundationStereo

[CVPR 2026] Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching

解決的問題

Fast-FoundationStereo 解決了立體匹配中精度與速度之間的權衡問題。現有的立體視覺基礎模型雖然具備強大的零樣本泛化能力(無需重新訓練即可在新資料上運作),但通常速度過慢,無法滿足即時應用需求。相反,高效的架構往往缺乏穩健性,且需要昂貴的領域特定微調。本專案提供了一組架構,在保持高零樣本精度的同時,能夠以即時幀率運行。

工作原理

該專案採用「分而治之」的加速策略,包含三個核心技術元件:

  1. 知識蒸餾:將複雜的混合骨幹網路壓縮為單一高效的學生模型。
  2. 區塊級神經架構搜尋(NAS):基於特定延遲預算自動尋找最佳成本過濾設計,以降低搜尋複雜度。
  3. 結構化剪枝:移除迭代精煉模組中的冗餘。

為支援訓練,作者開發了一條自動偽標籤流程,從 Stereo4D 資料集收集了 140 萬對真實場景下的立體影像對,以補充合成訓練資料。

適用對象

本工具專為從事即時深度估計、機器人與電腦視覺應用的開發者與研究人員設計,無需領域特定微調即可實現高品質立體匹配。

主要亮點

  • 即時性能:運行速度比原始 FoundationStereo 快 10 倍以上。
  • 零樣本泛化:無需額外訓練即可在未見資料上保持強準確性。
  • 靈活的權衡:提供多個檢查點和設定旗標(如 valid_itersscale),可靈活平衡速度與精度。
  • 部署就緒:支援導出為 ONNX 和 TensorRT(TRT),實現最佳化的 GPU 推論。

相關

  • 專案
  • 專案
  • 專案
  • 專案