QwenLM/Qwen3.8-Flash-Next
Qwen3.8-Flash-Next is the foundation model developed by Qwen Team, Alibaba Group.
何を解決するか
Qwen3.8-Flash-Next は、計算効率とトレーニングの安定性を最大化しつつ、コーディングおよびオフィス作業において高いパフォーマンスを維持するように設計されたマルチモーダルMixture-of-Experts(MoE)モデルです。これは、まもなく登場する Qwen4 ファミリーの初期アーキテクチャのプレビューとして機能しており、Qwen3.7-Plus と比較して、トレーニングおよび推論コストを大幅に削減するハイブリッドアーキテクチャを導入しています。
仕組み
このモデルは、4つの主要な領域で体系的なアップグレードを実施しています:
- Attention: Hybrid GDN + QSA アーキテクチャを使用。ゲート付きデルタネット(GDN)は効率的な履歴圧縮を処理し、Qwen スパースアテンション(QSA)は軽量インデクサを使用してマイクロブロックレベルで重要なコンテキストを選択し、長文シーケンスのコストを削減します。
- Residual: ゲート付きリジデュアル(GR)を実装。リジデュアルストリームを4つのブランチに拡張し、動的ゲートで情報フローを制御することで、安定性を向上させます。
- Embedding: N-gram Embedding を使用。局所的なコンテキストを利用して、最小限の計算でモデル容量をスケーリング可能。これらのテーブルはホストメモリにオフロードでき、非同期にプリフェッチ可能です。
- 最適化: Muon オプティマイザを採用。直交化精度と特定のパラメータ分割に最適化されており、再適合されたスケーリング法を用いています。
対象ユーザー
このモデルは、125Bパラメータ(1トークンあたり6Bがアクティブ)の高容量モデルを、トレーニングおよび実行コストが低い状態で利用したい開発者や研究者、および Qwen4 へのアーキテクチャ変更を検証したいコミュニティ向けです。
主な特徴
- 極めて高い効率性: Qwen3.7-Plus と比較して、トレーニングコストは約1/9に削減されながら、コーディングおよびオフィス作業のパフォーマンスはさらに向上しています。
- マルチモーダルMoE: マルチモーダル機能と Mixture-of-Experts アーキテクチャを統合しています。
- Hugging Face および ModelScope 対応: 重みは両プラットフォームで利用可能で、簡単に統合できます。
- 広範なデプロイメント対応: SGLang、vLLM、llama.cpp、MLX と互換性があり、高性能な推論が可能になります。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト