huggingface/pytorch-image-models

The largest collection of PyTorch image encoders / backbones. Including train, eval, inference, export scripts, and pretrained weights -- ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3 & V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet, ConvNeXt, and more

해결하는 문제

PyTorch Image Models (timm)는 최첨단(SOTA) 이미지 모델과 이를 사용하기 위한 필수 인프라를 통합한 중앙집중식 표준화된 라이브러리입니다. 개발자가 다양한 리포지토리에서 개별적으로 모델 아키텍처나 사전 학습된 가중치를 수동으로 구현하거나 찾을 필요 없이 ImageNet 학습 결과를 재현할 수 있게 해줍니다.

작동 방식

timm)은 포괄적인 모델 동물원 및 툴킷으로서 작동합니다. ViT, ConvNeXt, EfficientNet, MobileNet과 같은 다양한 비전 아키텍처를 통합하고, 모델 생성, 사전 학습된 가중치 로드, 추론을 위한 통일된 인터페이스를 제공합니다. 또한 Muon, Kron, AdamW와 같은 특수 최적화 알고리즘, 데이터 로더, 증강 전략을 포함한 트레이닝 및 검증에 필수적인 유틸리티도 제공합니다.

대상 사용자

이미지 분류, 특징 추출, 파인튜닝 등의 작업에 고성능 이미지 인코더와 백본이 필요한 컴퓨터 비전 연구자 및 개발자에게 적합합니다.

주요 특징

  • 광범위한 모델 컬렉션: Vision Transformers(ViT), ConvNeXt, 다양한 효율적인 모바일 백본을 포함한 방대한 SOTA 모델 지원.
  • NaFlexViT 지원: 다양한 종횡비, 해상도, 패치 크기를 처리할 수 있는 유연한 Vision Transformer 구현.
  • 고급 최적화 알고리즘: Muon, AdaMuon, Kron과 같은 특수 최적화 알고리즘을 포함하여 학습 효율성 향상.
  • 즉시 사용 가능한 인프라: 트레이닝, 검증, 추론용 참조 스크립트 제공 및 bfloat16, float16 정밀도 지원.
  • 광범위한 통합: Hugging Face Hub와의 원활한 통합을 통해 가중치 배포 가능하며, 다양한 PyTorch 버전을 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트