Hugging Face Transformers v5 release notes / what's new
Hugging Faceは、相互運用性と簡素化に焦点を当てた主要なアップデートであるTransformers v5 (v5.0.0rc-0)をリリースしました。このリリースにより、ライブラリはモデル定義のための標準化された「真実のソース」となり、AIエコシステム全体でトレーニング、推論、ローカルデプロイメント間のシームレスな移動を可能にします。
簡素化とモデル標準化
Transformers v5は、ライブラリがモデルアーキテクチャの業界標準のままであることを確保するため、クリーンでモジュラーなモデル定義を優先します。
モジュラー設計とモデル追加
メンテナンスの負荷を軽減し、新しいアーキテクチャの統合を加速するため、Hugging Faceはモジュラーアプローチを実装しました。この設計により、貢献とレビューに必要なコード行数が大幅に削減されます。重要な技術的追加は、AttentionInterfaceで、これは注意メソッド(FA1/2/3、FlexAttention、SDPAなど)を一元化し、モデリングファイル内にeagerメソッドを保持します。
自動変換のためのツール
機械学習ベースの新しいツールが開発されており、独立したモデリングファイルと既存のアーキテクチャ間の類似点を特定します。これにより、チームはモデル統合のためのドラフトPRを生成することで変換プロセスを自動化し、手作業を削減し、一貫性を確保できます。
コード削減とバックエンド統合
Transformers v5は、いくつかの重要なリファクタリングを通じてコードベースを合理化します:
- PyTorchとして唯一のバックエンド: ライブラリはFlaxとTensorFlowのサポートを終了し、PyTorchに専念しています。パートナーシップを通じてJAXエコシステムとの互換性は維持されています。
- トークナイザーのオーバーホール: 「Fast」および「Slow」トークナイザーの概念は、統一された
tokenizersバックエンドに置き換えられました。SentencepieceとMistralCommonのサポートは、デフォルト以外の代替手段として引き続き利用可能です。 - 画像処理: 画像プロセッサーは、高速バージョンのみが存在し、
torchvisionバックエンドに依存します。
トレーニング機能の強化
以前のバージョンがファインチューニングに重点を置いていたのに対し、v5はスケールでのプリトレーニングとフルトレーニングに大幅な改善をもたらします。
スケールでのプリトレーニング
大規模なプリトレーニングをサポートするため、Hugging Faceはモデル初期化を再構築し、フォワードとバックワードパス両方のカーネルを最適化しました。ライブラリは now、torchtitan、megatron、nanotronなどのプリトレーニングツールとの互換性を拡張しています。
ファインチューニングとポストトレーニング
Transformers v5は、Unsloth、Axolotl、LlamaFactory、TRLなどのPyTorchベースのファインチューニングツールとの深い互換性を維持します。また、MaxTextなどのJAXベースのツールとの相互運用性も確保します。
推論と本番環境への統合
Transformers v5は、モデル定義と高パフォーマンスなデプロイメントの間のギャップを埋める新しいAPIと専用カーネルを導入します。
新しい推論API
2つの主要な追加がサービング機能を強化します:
- Continuous Batching and Paged Attention: これらのメカニズムのサポートは今統合され、スループットが向上します。
transformers serve: OpenAI API互換のサーバーをデプロイする新しいサービングシステムで、評価ユースケースに特化して最適化されています。
エコシステムの相互運用性
専門的な推論エンジンと競合するのではなく、Transformers v5はそれらのバックエンドとして機能します。これにより、transformersに追加された新しいモデルは、vLLMやSGLangなどのエンジンですぐに利用可能になり、それらの特定の最適化(たとえば、ダイナミックバッチングと専用カーネル)を活用できます。
さらに、ライブラリはローカル推論ツールとの相互運用性を向上させます:
- GGUFサポート: ユーザーは now
transformersで直接GGUFファイルをロードしてファインチューニングを行ったり、transformersモデルをGGUFに変換してllama.cppで使用できます。 - MLX互換性:
transformersからのSafetensorsファイルは、MLXモデルと直接互換性があります。 - オンデバイスデプロイメント:
executorchチームおよびoptimum-executorchとのコラボレーションにより、マルチモーダル(ビジョンとオーディオ)モデルを含むオンデバイスでのモデル可用性が拡張されます。
ファーストクラスの量子化サポート
量子化は now Transformers v5の中心的な焦点となり、アドオンから重み読み込みプロセスにおけるファーストクラス市民へと移行しました。これにより、主要な機能との完全な互換性が確保され、トレーニングと推論の両方に信頼できるフレームワークが提供されます。この変更は、TorchAOとbitsandbytesとの統合によってサポートされ、低精度フォーマットにおけるテンソル並列性(TP)と専門家混合(MoE)のサポートが向上します。