推論のフロンティア: 10× 高速化されたモデルから自己最適化 AI へ — Baseten トーク サマリー
200 K‑トークン プロンプトの処理
200 000トークンのリクエストが到着すると、システムはまずプロンプト(またはその一部)が以前に見られたかどうかをチェックし、キャッシュされた KV キャッシュを再利用できるか確認します。見つからない場合は、リクエストをプリフィル ワーカーにルーティングし、そこで KV キャッシュを作成して最初のトークンを返し、その後キャッシュをデコード用の別の GPU セットに渡します。
キャッシュ対応ルーティングと分離されたプリフィル/デコード
キャッシュ対応ルーティングは、プリフィル ワーカーが利用可能であり、かつ理想的には一部のキャッシュ済み入力があるインスタンスを選択し、プリフィルを少なくとも一部のトークンについてスキップできるようにします。プリフィルとデコードの分離とは、一方の GPU セットが入力を処理し KV キャッシュを構築する一方で、別の GPU セットがデコードを実行しトークンを反復的に生成することを意味します。
スペキュラティブ デコード
小さなスペキュレータ モデルが数回の超積極的なフォワードパスを実行し、いくつかのトークンを予測します。その後、メイン モデルがこれらの予測を単一のフォワードパスで検証します。スペキュレータによって予測されたトークンが受け入れられると、ユーザーにストリームされ、デコードのレイテンシが削減されます。スペキュレータはトラフィック固有であり、コーディング ワークロードでは高いドラフトトークン受容率を達成します。
量子化とエラーの打ち消し
量子化は損失を伴いますが、速度が向上します。主な損失を伴う最適化は量子化であり、忠実度を保つためにどのレイヤーを量子化するかを選択し、外れ値を抑えるためにキャリブレーションを行います。量子化によるエラーは相殺されることがあります:特定のレイヤーを量子化すると、他のレイヤーのエラーを打ち消すエラーが生じ、少ないレイヤーのみを量子化するよりも忠実度の高いモデルが得られます。これにより、NVFP4 において 20% 以上のスループット向上が可能となり、他の量子化バージョンと比較して品質を維持または向上させることができます。
最大 10× 高速な推論の達成
最適化なしの 1兆パラメータ モデルのベースラインが約 30〜40 トークン/秒であることを出発点とし、量子化(各ステップで約30‑40% の向上)、2× スペキュレータ、分離されたプリフィル/デコード(約2×)、およびより良いカーネル/ランタイムを組み合わせることで、8× 以上の向上を達成できます。十分なトラフィックとハードウェアがあれば、ナイーブなデプロイメントと比較して 20%、100%、あるいは 200% の向上が可能であり、エンドツーエンドでの速度向上は最大 10× 達成できます。
NVIDIA Dynamo と KV‑対応ルーティング
Dynamo は、クラスター全体で KV キャッシュを移動するオープンソースの NVIDIA ライブラリであり、開発者向けツールキットであり、すぐに使える最適化ツールではありません。KV‑対応ルーティングは Dynamo を使用して KV キャッシュを必要な場所に配置し、分離をサポートし、ノード間でのキャッシュ転送によるレイテンシを削減します。
モデル並列化、自動チューニング、およびメガカーネル
テンソル並列化は、高帯域幅のインターコネクトを必要とする GPU にモデルをシャーディングします。エキスパート並列化は、各 GPU に完全なエキスパートを配置し、レプリケートされたルーターを使用することで、GPU間通信を削減します。パイプライン並列化は、単一ノードのメモリを超えるモデルに対してのみ使用され、マルチノード分割を強制します。自動チューニングは、スレッド数、共有メモリ、並列構成を掃引し、レイテンシ/スループットのトレードオフを実証的に最適な構成を見つけ出します。メガカーネル(多数の操作を融合)は記述が困難であり、起動オーバーヘッドと最適化の損失が利益を上回ることが多いため、モジュラーカーネルよりも遅くなる傾向があります。
ハードウェアのトレンド:Rubin、GPU vs. ASIC
将来の GPU である Rubin は、CPU‑GPU および GPU‑GPU インターコネクトの高速化を強調し、KV キャッシュのオフロードとシステムレベルの最適化の重要性を高めます。GPU は ASIC ライクなテンソルコアや専用命令を獲得しつつもプログラマブルであるままです。モデルの重みをシリコンに完全に焼き込むと、ファインチューニング、量子化、新しいチェックポイントが不可能になるため、純粋な ASIC へのシフトよりも専門化のスペクトラムが現実的です。
ビデオ生成の課題
一貫した長尺ビデオの生成は、二次的な注意ボトルネックに直面します:16 fps と 480p でも、5秒のビデオは約 35 000 トークンに相当し、より長いクリップでは何百万トークンにも及ぶ注意が必要になります。このようなシーケンスに対するフル注意は現実的ではなく、研究はスパース/時空間注意または自己回帰型ビデオモデルへと向かっています。現在のオープンソースの自己回帰型ビデオモデルは品質ドリフトに苦しんでおり、拡散モデルは Veo や Kling などのクローズドソースの代替品と比較してスケールにおいて制限されています。
持続的学習と自己最適化モデル
持続的学習は、モデルの重みを更新するか、KV キャッシュの圧縮を行うことでアプローチできます。後者は重みを変更せずに知識を保持し、推論時の学習を可能にします。GLM‑5.2 は自己最適化を実証しました:自身の推論をプロファイリングし、ボトルネックカーネルを特定し、新しいカーネルを作成し、サイクルを繰り返しました。Baseten の推論エンジンにおける一部の GPU カーネルは、GLM‑5.2 自身によって作成されました。これは、モデルがそれ自身を実行するインフラストラクチャを最適化するループを示しています。
締めくくりの考え
推論エンジニアリングは、単にモデルを高速に動作させることから、カーネル、ハードウェアインターコネクト、モデル設計、持続的学習を含むシステム問題へと進化しています。モデルが大きくなり、ハードウェアが進歩するにつれて、推論からさらに 10×、100×、あるいは 1000× の性能を引き出す競争は続き、より高速なネットワーク、より良い KV‑キャッシュ管理、および自身のサービススタックを改善できるモデルによって推進されます。