PaddlePaddle/ERNIE

The official repository for ERNIE 4.5 and ERNIEKit – its industrial-grade development toolkit based on PaddlePaddle.

What it solves

ERNIE 4.5は、テキスト理解、画像/動画理解、およびクロスモーダル推論において最先端の性能を提供するように設計された大規模マルチモーダルモデルのファミリーです。マルチモーダルモデルの学習において、ある種のモダリティが他のモダリティの学習を妨げるという課題に対し、解決策を提供すると同時に、様々なハードウェアプラットフォーム上で効率的な学習と高性能な推論を実現するためのスケーラブルなインフラストラクチャを提供します。

How it works

本プロジェクトは、モダリティ間でパラメータを共有しつつ、各モダリティに専用のパラメータを保持する異種混合エキスパート (MoE) アーキテクチャを採用しています。これは、モダリティ分離型ルーティング (modality-isolated routing) と特定の損失関数 (router orthogonal and multimodal token-balanced loss) によってサポートされており、テキストと視覚データの相互補完を確実にするためのものです。モデルは PaddlePaddle 深層学習フレームワーク上に構築されており、混合並列、FP8 混合精度トレーニング、および高度な量子化 (4-bit/2-bit) を用いて効率的なデプロイメントを実現します。

Who it’s for

本プロジェクトは、指示に従うこと、世界知識の記憶、および視覚的推論などのタスクのために、高性能な LLM または視覚言語モデル (VLMs) を必要とする AI 研究者や開発者向けです。また、SFT、DPO、または LoRA を用いてモデルを微調整するためのツールも提供しています。

Highlights

  • Multimodal Heterogeneous MoE: テキストの性能を損なうことなく、マルチモーダル理解を強化する新しい構造。
  • Scaling-Efficient Infrastructure: ノード内エキスパート並列化 (intra-node expert parallelism) とメモリ効率の高いパイプラインスケジューリングにより、高い事前学習スループットを実現。
  • Thinking and Non-Thinking Modes: VLMs は、知覚と複雑な推論のバランスを保つために、両方のモードをサポートしています。
  • ERNIEKit & FastDeploy: 学習、圧縮、および本番環境向けの推論の全ライフサイクルをカバーする、産業グレードのツールキット。

関連

  • プロジェクト
  • Dispatch
  • Dispatch
  • プロジェクト
  • プロジェクト