InternLM/xtuner

A Next-Generation Training Engine Built for Ultra-Large MoE Models

What it solves

XTuner V1は、超大規模混合エキスパート (MoE) モデルのトレーニングの複雑さを処理するために設計されたトレーニングエンジンです。1兆パラメータに達するモデルの高メモリおよび計算需要を満たし、同時にハードウェア上でこれらのモデルをスケールアップするための並列化戦略を簡化化します。

How it works

XTuner V1は、いくつかの主要な技術的アプローチを通じてトレーニングプロセスを最適化します:

  • Dropless Training: エキスパート並列化の複雑さを軽減し、200B規模のMoEモデルをそれなしでトレーニング可能にし、600Bモデルにはノード内並列化 (intra-node parallelism) のみを必要とさせます。
  • Memory Optimization: シーケンス並列化 (sequence parallelism) を必要とせずに、64kのシーケンス長で200B MoEモデルのトレーニングを可能にします。また、DeepSpeed Ulyssesによるシーケンス長の線形スケーリングもサポートします。
  • Hardware Acceleration: このエンジンはNVIDIA GPU (FP8/BF16) と Ascend NPU (BF16) の両方に最適化されており、200Bパラメータを超えるモデルにおいて、従来の3D並列化スキームを上回る高いスループットを実現します。

Who it’s for

このツールは、超大規模MoEモデルに取り組むAI研究者やエンジニアを対象としており、特に大規模な事前学習、指示チューニング、および強化学習 (RL) に注力している人々を対象としています。

Who it’s for

このツールは、超大規模MoEモデルに取り組むむAI研究者やエンジニアを対象としており、特に大規模な事前学習、指示チューニング、および強化学習 (RL) に注力している人々を対象としています。

Highlights\n

  • Massive Scale Support: 最大1TパラメータのMoEモデルのトレーニングが可能です。
  • Multimodal Capabilities: Vision-language modelの事前学習と教師あり微調整をフルサポートします。
  • Advanced RL Algorithms: Group Relative Policy Optimization (GRPO) を実装し、MPOやDAPOへの拡張も進めています。
  • Cross-Hardware Compatibility: NVIDIA H800とAscend A3 Supernodesの両方に最適化されています。