NVlabs/Fast-FoundationStereo
[CVPR 2026] Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching
解決的問題
Fast-FoundationStereo 解決了立體匹配中精度與速度之間的權衡問題。現有的立體視覺基礎模型雖然具備強大的零樣本泛化能力(無需重新訓練即可在新資料上運作),但通常速度過慢,無法滿足即時應用需求。相反,高效的架構往往缺乏穩健性,且需要昂貴的領域特定微調。本專案提供了一組架構,在保持高零樣本精度的同時,能夠以即時幀率運行。
工作原理
該專案採用「分而治之」的加速策略,包含三個核心技術元件:
- 知識蒸餾:將複雜的混合骨幹網路壓縮為單一高效的學生模型。
- 區塊級神經架構搜尋(NAS):基於特定延遲預算自動尋找最佳成本過濾設計,以降低搜尋複雜度。
- 結構化剪枝:移除迭代精煉模組中的冗餘。
為支援訓練,作者開發了一條自動偽標籤流程,從 Stereo4D 資料集收集了 140 萬對真實場景下的立體影像對,以補充合成訓練資料。
適用對象
本工具專為從事即時深度估計、機器人與電腦視覺應用的開發者與研究人員設計,無需領域特定微調即可實現高品質立體匹配。
主要亮點
- 即時性能:運行速度比原始 FoundationStereo 快 10 倍以上。
- 零樣本泛化:無需額外訓練即可在未見資料上保持強準確性。
- 靈活的權衡:提供多個檢查點和設定旗標(如
valid_iters和scale),可靈活平衡速度與精度。 - 部署就緒:支援導出為 ONNX 和 TensorRT(TRT),實現最佳化的 GPU 推論。
相關
- 專案
- 專案
- 專案
- 專案