AMD、AI推論用のモデル特化型集積回路(MSIC)の実装に向けてTaalasを買収
AMDは、推論に対して根本的に異なるアプローチを実装することで、AIハードウェアにおけるNvidiaの支配に挑戦するため、トロントを拠点とするAIチップ・スタートアップのTaalasを買収しました。従来のGPUやデータフロー・アーキテクチャとは異なり、Taalasはモデルの重みをシリコンに直接刻み込むモデル特化型集積回路(MSIC)を利用しており、推論中の重み保存のための高帯域幅メモリ(HBM)を必要としません。
推論スループットの大幅な向上
モデルの重みをシリコンに刻み込むことで、メモリ帯域幅のボトルネックを解消し、トークン生成速度を劇的に向上させることができます。
Taalasの最初のテストチップであるHC1(TSMCの6nmプロセスで製造)は、MetaのLlama 3.1 8Bを毎秒16,960トークンで提供できる能力を示しました。発表時点では、このパフォーマンスはNvidiaのGPUよりも約48倍速く、Cerebrasのアクセラレータよりも8.5倍速いものでした。
ハードウェア・アーキテクチャ
Taalasプロセッサは、主に2つの機能領域に分かれています:
- Mask-ROM Recall Fabric: この場所には、モデルの重みがシリコンに恒久的に刻み込まれます。
- SRAM Recall Fabric: この領域はKVキャッシュとファインチューニング・アダプターを保存し、固定された重みにもかかわらず、ある程度の柔軟性を持たせることができます。
大規模モデルへのスケーリング
第2世代のHC2チップでは、Taalasはチップあたり最大200億パラメータをサポートすることを目指しています。兆単位のパラメータを持つモデルをサポートするために、AMDはパイプライン並列化を利用して、複数のアクセラレータに重みを分散させることができます。1兆パラメータのモデルの場合、約50個のHC2アクセラレータが必要になります。このアプローチは、NvidiaのLPXのような現在のラック・システム(数千のLPUを同等の結果を得るために必要とするもの)よりも、大幅にスペースと電力の効率が向上しています。
AMD Heliosラックへの戦略的統合
AMDは、Taalasベースのアクセラレータを自社のInstinctベースのHeliosラックと組み合わせ、非集約型アーキテクチャを構築することを意図しています。このセットアップでは、計算負荷の高いプロンプト処理はGPUが担当し、高速なトークン生成はTaalas MSICにオフロードされます。
AMDはまた、「チック・トック」展開戦略を実装する可能性があります:顧客はまず柔軟なInstinctアクセラレータでモデルを検証し、モデルが確定した後に、本番規模の高性能推論のためにTaalasアクセラレータに移行します。
トレードオフ:柔軟性とパフォーマンス
MSICの主な欠点は、柔軟性の欠如です。重みがシリコンに刻み込まれているため、大幅なモデルの更新が必要な場合は、ハードウェアの再スピン(re-spin)が必要です。
軽減策とコスト
更新のコストと時間を短縮するために、Taalasは、再スピンには製造プロセスを最初からやり直すのではなく、2つの金属層のみを変更すればよいと主張しています。さらに、同社は、重みをシリコンに刻み込むことは、最先端モデルの初期トレーニングよりも100倍安価であると示唆しています。
ターゲットとなるユースケース
ハードウェアの硬直性により、この技術は以下のようなケースで採用される可能性が最も高いです:
- Frontier Model Developers: OpenAI、Anthropic、Metaなどの、安定した高トラフィックのモデルを持つ企業。
- Infrastructure Providers: トークンあたりのコストを下げたい大規模推論プロバイダー。
- Embedded Systems and IoT: ロボティクスやエッジデバイスなど、低遅延かつローカル推論が不可欠であり、モデルの更新が頻繁ではない環境。
AI開発とUXへの影響
推論速度の向上は、AIモデルの利用方法や開発方法を根本的に変える可能性があります:
Test-Time Scaling: モデル開発者は、ユーザーを不当に待たせることなく、ハルシネーションを低減し、精度を向上させるために、モデルに「思考」させる時間を長くする(test-time scaling)ことができます。
Multi-Agent Orchestration: 極めて高いトークン/秒(TPS)により、数十または数百の特化型サブエージェントを使用して、知覚的な遅延を犠牲にすることなく、リアルタイムで出力を検証・修正することが可能になります。
New UX Patterns: 高速推論は、「入力中に検索」するようなAIインタラクションや、すべてのデジタル情報をリアルタイムで拡張するような体験を可能にします。
コミュニティの視点と技術的分析
業界の観察者や開発者は、Taalas買収に関して、いくつかの重要なポイントを指摘しています:
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch