huggingface/pytorch-image-models

The largest collection of PyTorch image encoders / backbones. Including train, eval, inference, export scripts, and pretrained weights -- ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3 & V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet, ConvNeXt, and more

解決的問題

PyTorch Image Models (timm) 提供一個集中化、標準化的最尖端(SOTA)影像模型及其使用所需基礎設施的程式庫。它消除了開發者在不同程式庫中手動實作或搜尋分散的模型架構與預訓練權重的需要,進而實現可重現的 ImageNet 訓練結果。

如何運作

timm) 作為一個全面的模型動物園與工具包。它整合了大量視覺架構(如 ViT、ConvNeXt、EfficientNet 和 MobileNet),並提供統一介面以進行模型建立、預訓練權重載入與推論。該程式庫也包含訓練與驗證所需的必要工具,包括專用最佳化器(如 Muon、Kron 和 AdamW)、資料載入器與增強策略。

適用對象

專為需要存取多種高效率影像編碼器與骨幹網路的電腦視覺研究人員與開發者設計,適用於影像分類、特徵萃取與微調等任務。

主要亮點

  • 廣泛的模型集合:支援大量 SOTA 模型,包括視覺 Transformer (ViT)、ConvNeXt 以及各種高效能的行動骨幹網路。
  • NaFlexViT 支援:實作可處理變動長寬比、解析度與補丁大小的彈性視覺 Transformer。
  • 進階最佳化器:包含 Muon、AdaMuon 與 Kron 等專用最佳化演算法,以提升訓練效率。
  • 即時可用的基礎設施:提供訓練、驗證與推論的參考腳本,並支援 bfloat16float16 精度。
  • 廣泛整合:與 Hugging Face Hub 無縫整合以分發權重,並支援多種 PyTorch 版本。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案