Hugging Face Transformers v5 release notes / what's new

Hugging Faceは、相互運用性と簡素化に焦点を当てた主要なアップデートであるTransformers v5 (v5.0.0rc-0)をリリースしました。このリリースにより、ライブラリはモデル定義のための標準化された「真実のソース」となり、AIエコシステム全体でトレーニング、推論、ローカルデプロイメント間のシームレスな移動を可能にします。

簡素化とモデル標準化

Transformers v5は、ライブラリがモデルアーキテクチャの業界標準のままであることを確保するため、クリーンでモジュラーなモデル定義を優先します。

モジュラー設計とモデル追加

メンテナンスの負荷を軽減し、新しいアーキテクチャの統合を加速するため、Hugging Faceはモジュラーアプローチを実装しました。この設計により、貢献とレビューに必要なコード行数が大幅に削減されます。重要な技術的追加は、AttentionInterfaceで、これは注意メソッド(FA1/2/3、FlexAttention、SDPAなど)を一元化し、モデリングファイル内にeagerメソッドを保持します。

自動変換のためのツール

機械学習ベースの新しいツールが開発されており、独立したモデリングファイルと既存のアーキテクチャ間の類似点を特定します。これにより、チームはモデル統合のためのドラフトPRを生成することで変換プロセスを自動化し、手作業を削減し、一貫性を確保できます。

コード削減とバックエンド統合

Transformers v5は、いくつかの重要なリファクタリングを通じてコードベースを合理化します:

  • PyTorchとして唯一のバックエンド: ライブラリはFlaxとTensorFlowのサポートを終了し、PyTorchに専念しています。パートナーシップを通じてJAXエコシステムとの互換性は維持されています。
  • トークナイザーのオーバーホール: 「Fast」および「Slow」トークナイザーの概念は、統一されたtokenizersバックエンドに置き換えられました。SentencepieceとMistralCommonのサポートは、デフォルト以外の代替手段として引き続き利用可能です。
  • 画像処理: 画像プロセッサーは、高速バージョンのみが存在し、torchvisionバックエンドに依存します。

トレーニング機能の強化

以前のバージョンがファインチューニングに重点を置いていたのに対し、v5はスケールでのプリトレーニングとフルトレーニングに大幅な改善をもたらします。

スケールでのプリトレーニング

大規模なプリトレーニングをサポートするため、Hugging Faceはモデル初期化を再構築し、フォワードとバックワードパス両方のカーネルを最適化しました。ライブラリは now、torchtitanmegatronnanotronなどのプリトレーニングツールとの互換性を拡張しています。

ファインチューニングとポストトレーニング

Transformers v5は、Unsloth、Axolotl、LlamaFactory、TRLなどのPyTorchベースのファインチューニングツールとの深い互換性を維持します。また、MaxTextなどのJAXベースのツールとの相互運用性も確保します。

推論と本番環境への統合

Transformers v5は、モデル定義と高パフォーマンスなデプロイメントの間のギャップを埋める新しいAPIと専用カーネルを導入します。

新しい推論API

2つの主要な追加がサービング機能を強化します:

  • Continuous Batching and Paged Attention: これらのメカニズムのサポートは今統合され、スループットが向上します。
  • transformers serve: OpenAI API互換のサーバーをデプロイする新しいサービングシステムで、評価ユースケースに特化して最適化されています。

エコシステムの相互運用性

専門的な推論エンジンと競合するのではなく、Transformers v5はそれらのバックエンドとして機能します。これにより、transformersに追加された新しいモデルは、vLLMやSGLangなどのエンジンですぐに利用可能になり、それらの特定の最適化(たとえば、ダイナミックバッチングと専用カーネル)を活用できます。

さらに、ライブラリはローカル推論ツールとの相互運用性を向上させます:

  • GGUFサポート: ユーザーは now transformersで直接GGUFファイルをロードしてファインチューニングを行ったり、transformersモデルをGGUFに変換してllama.cppで使用できます。
  • MLX互換性: transformersからのSafetensorsファイルは、MLXモデルと直接互換性があります。
  • オンデバイスデプロイメント: executorchチームおよびoptimum-executorchとのコラボレーションにより、マルチモーダル(ビジョンとオーディオ)モデルを含むオンデバイスでのモデル可用性が拡張されます。

ファーストクラスの量子化サポート

量子化は now Transformers v5の中心的な焦点となり、アドオンから重み読み込みプロセスにおけるファーストクラス市民へと移行しました。これにより、主要な機能との完全な互換性が確保され、トレーニングと推論の両方に信頼できるフレームワークが提供されます。この変更は、TorchAObitsandbytesとの統合によってサポートされ、低精度フォーマットにおけるテンソル並列性(TP)と専門家混合(MoE)のサポートが向上します。

Sources