frgfm/holocron

PyTorch implementations of recent Computer Vision tricks (ReXNet, RepVGG, Unet3p, YOLOv4, CIoU loss, AdaBelief, PolyLoss, MobileOne). Other additions: AdEMAMix

What it solves

Holocron 是一个提供近期计算机视觉深度学习技术高质量实现的实现库。它提供了一个集中的集合,包含专门的 PyTorch 层、损失函数和模型架构,否则用户将需要从各种研究论文中搜索并实现它们。

How it works

该库直接集成到 PyTorch 生态系统中,允许用户将这些实现与他们自己的框架和模型库进行配对。它提供了一系列预训练模型和组件,包括:

  • Layers & Components: 专门的激活函数(例如:HardMish)、卷积(例如:NormConv2d)、池化(例如:BlurPool2d)和注意力机制(例如:SAM)。
  • Architectures: 图像分类模型(例如:RepVGG, ConvNeXt)、目标检测(YOLOv1-v4)和语义分割(U-Net, UNet++)的实现。
  • Optimizers: Adam 的替代方案,例如 LARS, Lamb, 和 Adan。

Who it’s for

它是为计算机视觉研究人员和开发人员设计的,他们需要可靠、即插即用的最先进视觉模型和层,以加速他们的开发和实验。

Highlights

  • Broad Component Library: 包含广泛的激活函数、损失函数、卷积和优化器。
  • Hugging Face Integration: 提供托管在 Hugging Face Spaces 上的实时演示应用。
  • Latency Benchmarks: 为支持的模型提供详细的 GPU/CPU 延迟数据,以帮助用户选择适合其硬件的架构。
  • Deployment Ready: 包含 Dockerfile 和 FastAPI 模板,以便快速将模型部署为部署为 REST API。