AMD Ryzen AI Halo Review: 128 GB Unified Memory Enables 120 B‑Parameter Local AI

AMD Ryzen AI Halo Review: 128 GB Unified Memory Enables 120 B‑Parameter Local AI

TL;DR

AMD Ryzen AI Halo の 128 GB の統合 LPDDR5X メモリにより、はるかに大きなローカル AI モデル(最大 120 B パラメータ)や複数のモデルを同時に実行でき、クラウド API のコストをかけずにデスクトップ 1 台で高品質な生成 AI が可能になります。

What Makes the Ryzen AI Halo Different?

  • Unified Memory Architecture – CPU と GPU が 128 GB の単一プールを共有し、ほとんどを GPU に割り当ててモデルを保存できます。これにより、ディスクリート GPU が VRAM を使い果たしてシステム RAM にオフロードする際に発生する性能低下が解消されます。
  • Chipset Specs – 本システムは Ryzen AI Max + 395 SoC(16 コア CPU)と Radeon 8060S GPU(≈60 TFLOPs FP16)、そして約 50 TOPS を提供する NPU で構成されています。現在の LLM スタックは NPU をほとんど利用しませんが、将来のソフトウェアで活用できる可能性があります。
  • Scalable Memory Options – AMD は将来の Pro 495 バリアントで最大 192 GB のメモリを提供すると発表しており、さらに大規模なワークロードに対応できるようになります。

Out‑of‑the‑Box Experience

  • Two OS Flavors – Windows エディションと Linux エディションが用意されています。Linux バージョンは ROCm、ドライバ、各種 AI ツールが事前に設定された状態で出荷され、手動でのドライバインストールが不要です。
  • AMD Ryzen AI Developer Center – システムソフトウェアのバージョン確認、GPU メモリ割り当て管理、事前インストールされた AI アプリケーション(例: Llama CPP、ComfyUI)起動用の統合 UI。メモリ分割はデフォルトで GPU が 75 % で、いつでも変更可能です。
  • Remote Access – SSH 対応により、Halo をヘッドレス AI サーバーとして扱え、バックグラウンドの推論やトレーニングジョブに最適です。
  • Playbooks – 一般的なタスク(LLM サービング(LMStudio 使用)、画像生成(ComfyUI 使用)、ファインチューニング(Unsloth 使用)、カスタム GPU カーネル開発)向けのステップバイステップガイド。初心者・中級者・上級者向けに分類されています。

Large Language Model Performance

Model Type Tokens / s
Ornith 9B (dense) MTP drafter ~40
Qwen 3.6 35B MoE (3 B active) MoE + drafter >50
GPT‑OSS 120B (MoE) Mixture of Experts ~30
  • Observation: 120 B パラメータの GPT‑OSS でも 30 t/s 程度の実用的な速度で動作し、チャットや RAG アプリケーションに適しています。エージェント系ワークロードには、より小さく高速なモデルが好まれます。
  • Memory Advantage: これらのモデルはすべて VRAM の上限に達することなくロードでき、従来の 32 GB Radeon AI Pro R9700 ワークステーションでの制約を克服しています。

Image & Video Generation with ComfyUI

  • Pre‑installed Models – ImageZ が同梱されており、追加モデル(例: Qwen 画像モデル、LTX 動画モデル)もダウンロード可能です。
  • Workflow – ComfyUI の API を利用し、以下のパイプラインをスクリプト化しました:
    1. LLM で多様なプロンプトを生成。
    2. 1 枚あたり約 19 秒で多数の子猫ダンス画像をレンダリング。
    3. 画像を LTX に渡し、短い動画クリップを生成。
  • Cost Efficiency – 夜間に Halo で実行すると電気代のみで済み、商用クラウド API の $0.10 / s といった費用を回避できます。

Running Local Agents (Hermes‑Agent)

  • Setup – LMStudio 経由でインストールし、Qwen 3.6 3.5B モデルとスペキュレーティブデコーディング(MTP)を使用。
  • Capabilities – 関数呼び出し、スキル実行が可能で、Ornith 9B や Qwen 3.6 など複数のロード済みモデル間をリロードせずに切り替えられます。
  • Use‑Case – 24/7 稼働のローカルエージェントは、トークンコストがゼロで 1 日に数百万トークンを処理でき、電力消費のみが制約となります。

Fine‑Tuning with Unsloth

  • Process – Playbook が環境構築、データセット取得、4 B Gemma モデルの LoRA 学習を自動化します。
  • Training Tricks – 勾配蓄積により、限られた GPU メモリでも実質的に大きなバッチサイズが使用可能(例: 4 ステップでバッチ 16 相当)です。
  • Performance – Halo 上で数時間で学習が完了し、夜間ジョブも安定。負荷時にファンは回転しますが過熱は見られませんでした。

Who Should Consider the Ryzen AI Halo?

  • Large‑Model Enthusiasts – プライバシーやオフライン実行が必要な、40 B 以上のオープンウェイトモデルをローカルで走らせたい研究者・開発者。
  • Multi‑Model Workloads – 複数の LLM や LLM と拡散モデルを同時に使用したいシナリオ。
  • Cost‑Sensitive Creators – 高頻度の画像・動画生成を行い、継続的なクラウド費用を抑えたいコンテンツ制作者。
  • Budget‑Conscious Builders – 大規模モデル推論に匹敵する性能を持つディスクリート GPU ワークステーションに比べ、競争力のある価格で提供される Halo を検討する方。

Limitations & Future Outlook

  • NPU Utilization – 現行のソフトウェアエコシステムでは 50 TOPS NPU の活用がほとんどありませんが、将来の AMD またはサードパーティフレームワークで活用できる可能性があります。
  • Memory Trade‑offs – 統合メモリのため CPU と GPU の割り当てバランスを調整する必要があります。システム RAM を大量に消費するワークロードは慎重なチューニングが求められます。
  • Scaling Beyond 128 GB – 今後登場する Pro 495 バリアントは最大 192 GB を提供し、モデルサイズの上限をさらに拡大します。

Final Thoughts

AMD Ryzen AI Halo は、統合メモリアーキテクチャが非常に大規模な言語モデルや拡散モデルへのアクセスを民主化できることを示しています。VRAM のボトルネックを排除し、すぐに使えるソフトウェアスタックを同梱することで、開発者は 120 B パラメータの LLM、マルチモデルパイプライン、夜間の生成プロジェクトをすべてオンプレミスで、クラウドコストのごく一部で実行可能にします。


Links

Sources