huggingface/pytorch-image-models

The largest collection of PyTorch image encoders / backbones. Including train, eval, inference, export scripts, and pretrained weights -- ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3 & V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet, ConvNeXt, and more

何を解決するか

PyTorch Image Models (timm) は、最先端(SOTA)の画像モデルとそれらを使用するための必要なインフラを統合した中央集権的で標準化されたライブラリを提供します。開発者が異なるリポジトリ間で個別にモデルアーキテクチャや事前学習済み重みを手動で実装したり探したりする必要がなくなり、ImageNetの再現可能な訓練結果を実現できます。

仕組み

timm) は包括的なモデルズーライブラリおよびツールキットとして機能します。ViT、ConvNeXt、EfficientNet、MobileNetなどの多様なビジョンアーキテクチャを統合し、モデル作成、事前学習済み重みの読み込み、推論のための統一インターフェースを提供します。また、特別な最適化手法(Muon、Kron、AdamWなど)、データローダー、増強戦略を含む、トレーニングと検証に不可欠なユーティリティも備えています。

対象ユーザー

画像分類、特徴抽出、ファインチューニングなどのタスクに高パフォーマンスな画像エンコーダーとバックボーンが必要なコンピュータビジョン研究者や開発者向けに設計されています。

主な特徴

  • 広範なモデルコレクション: Vision Transformers (ViT)、ConvNeXt、さまざまな効率的なモバイルバックボーンを含む、膨大なSOTAモデルをサポート。
  • NaFlexViTのサポート: 変動するアスペクト比、解像度、パッチサイズに対応可能な柔軟なVision Transformerを実装。
  • 高度な最適化手法: Muon、AdaMuon、Kronなどの特別な最適化アルゴリズムを含み、トレーニング効率を向上。
  • 即時利用可能なインフラ: トレーニング、検証、推論用のリファレンススクリプトを提供し、bfloat16 および float16 の精度をサポート。
  • 広範な統合: Hugging Face Hubとのシームレスな統合により重みの配布を可能にし、さまざまなPyTorchバージョンをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト