BGU-CS-VIL/WTConv
Wavelet Convolutions for Large Receptive Fields. ECCV 2024.
解決的問題
解決了在卷積神經網路(CNN)中實現大感受野的挑戰,而無需承擔使用超大卷積核所帶來的典型計算開銷。
工作原理
WTConv 實作了小波卷積,利用小波變換擴展網路的視野。它提供了 2D 和 1D 的實作(WTConv2d 和 WTConv1d),可輕鬆整合至現有的 CNN 架構中。為提升效能,專案包含一個名為 fast_wtconv 的高效能實作,針對 CUDA、Metal(MPS)和 Triton 後端進行了優化。
適用對象
從事電腦視覺與訊號處理的研究人員與開發者,希望在保持效率的同時提升模型的感受野。
主要亮點
- 大感受野:專為擴大卷積運算可「看到」的影像區域而設計。
- 優化的後端:包含
fast_wtconv,可在 CUDA、Metal 和 Triton 上實現高效能執行。 - 預訓練模型:提供於 ImageNet-1K 上訓練的 WTConvNeXt 模型(Tiny、Small 和 Base)。
- 靈活整合:與
timm模型註冊表相容,便於部署。
相關
- 專案
- 專案
- 專案
- 專案
- 專案