huggingface/pytorch-image-models

The largest collection of PyTorch image encoders / backbones. Including train, eval, inference, export scripts, and pretrained weights -- ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3 & V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet, ConvNeXt, and more

解决的问题

PyTorch Image Models (timm) 提供了一个集中化、标准化的最先进的(SOTA)图像模型及其使用所需基础设施的库。它消除了开发者在不同仓库中手动实现或搜寻分散的模型架构和预训练权重的需要,从而实现可复现的 ImageNet 训练结果。

如何工作

timm) 作为一个全面的模型动物园和工具包。它集成了大量视觉架构(如 ViT、ConvNeXt、EfficientNet 和 MobileNet),并提供统一的接口用于模型创建、预训练权重加载和推理。该库还包含训练和验证所需的必要工具,包括专用优化器(如 Muon、Kron 和 AdamW)、数据加载器和增强策略。

适用人群

专为需要访问多种高性能图像编码器和骨干网络的计算机视觉研究人员和开发者设计,适用于图像分类、特征提取和微调等任务。

主要亮点

  • 丰富的模型集合:支持大量 SOTA 模型,包括视觉 Transformer (ViT)、ConvNeXt 以及各种高效的移动骨干网络。
  • NaFlexViT 支持:实现了可处理可变长宽比、分辨率和补丁大小的灵活视觉 Transformer。
  • 高级优化器:包含 Muon、AdaMuon 和 Kron 等专用优化算法,以提升训练效率。
  • 开箱即用的基础设施:提供训练、验证和推理的参考脚本,并支持 bfloat16float16 精度。
  • 广泛集成:与 Hugging Face Hub 无缝集成以分发权重,并支持多种 PyTorch 版本。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目