AMD Ryzen AI Halo 評測:128 GB 統一記憶體讓 120 B 參數本地 AI 成為可能

AMD Ryzen AI Halo 評測:128 GB 統一記憶體讓 120 B 參數本地 AI 成為可能

TL;DR

AMD Ryzen AI Halo 的 128 GB 統一 LPDDR5X 記憶體讓你能執行更大的本地 AI 模型——最高可達 120 B 參數——並同時運行多個模型,使高品質生成式 AI 在單一桌上型電腦上成為可能,且不必支付雲端 API 的費用。

Ryzen AI Halo 有何不同?

  • 統一記憶體架構 – CPU 與 GPU 共享同一個 128 GB 池子,你可以將大部分記憶體分配給 GPU 用於模型儲存。這消除了當獨立 GPU 用盡 VRAM 而被迫切換到較慢系統記憶體時的效能斷層。
  • 晶片規格 – 系統搭載 Ryzen AI Max + 395 SoC,具 16 核心 CPU、Radeon 8060S GPU(≈60 TFLOPs FP16)以及提供約 50 TOPS 的 NPU。目前的 LLM 堆疊很少使用 NPU,但未來的軟體可能會利用它。
  • 可擴充記憶體選項 – AMD 宣佈未來的 Pro 495 變體將提供最高 192 GB 記憶體,進一步提升更大工作負載的上限。

開箱體驗

  • 兩種作業系統版本 – 提供 Windows 版與 Linux 版。Linux 版預先配置好 ROCm、驅動程式與一套 AI 工具,免除手動安裝驅動的麻煩。
  • AMD Ryzen AI Developer Center – 集中式 UI,可檢視系統軟體版本、管理 GPU 記憶體分配、啟動預裝的 AI 應用程式(例如 Llama CPP、ComfyUI)。記憶體預設分配為 75 % 給 GPU,隨時可調整。
  • 遠端存取 – 支援 SSH,讓 Halo 可作為無頭 AI 伺服器使用,適合背景推論或訓練工作。
  • Playbooks – 為常見任務提供一步步指南(LLM 服務部署(LMStudio)、使用 ComfyUI 產生影像、使用 Unsloth 微調、客製 GPU 核心開發)。Playbooks 依新手、進階與高階使用者分類。

大型語言模型效能

Model Type Tokens / s
Ornith 9B (dense) MTP drafter ~40
Qwen 3.6 35B MoE (3 B active) MoE + drafter >50
GPT‑OSS 120B (MoE) Mixture of Experts ~30
  • 觀察:即使是 120 B 參數的 GPT‑OSS 也能以可用的 30 t/s 速度運行,足以支援聊天或 RAG 應用。較小且更快的模型更適合代理工作負載。
  • 記憶體優勢:所有這些模型皆可載入而不會觸及 VRAM 上限,這在先前的 32 GB Radeon AI Pro R9700 工作站上是個限制。

使用 ComfyUI 產生影像與影片

  • 預裝模型 – 包含 ImageZ,並支援下載額外模型(例如 Qwen 影像模型、LTX 影片模型)。
  • 工作流程 – 透過 ComfyUI 的 API,作者編寫了一條管線:
    1. 使用 LLM 產生多樣化提示。
    2. 渲染數十張小貓跳舞圖像(≈19 秒/張)。
    3. 將圖像送入 LTX 產出短影片剪輯。
  • 成本效益 – 在 Halo 上整夜運行僅產生電費,避免了專有服務常見的 $0.10 / s 雲端 API 費用。

本地代理執行(Hermes‑Agent)

  • 設定 – 透過 LMStudio 安裝,使用 Qwen 3.6 3.5B 模型搭配推測解碼(MTP)。
  • 功能 – 支援函式呼叫、技能執行,且可在多個已載入模型間切換(如 Ornith 9B、Qwen 3.6)而不需重新載入。
  • 使用情境 – 24/7 本地代理每日可處理數百萬 token,零 token 成本,唯一限制為電力消耗。

使用 Unsloth 微調

  • 流程 – Playbook 自動化環境建置、資料集下載與對 4 B Gemma 模型的 LoRA 訓練。
  • 訓練技巧 – 梯度累積允許在有限的 GPU 記憶體上模擬更大的批次(例如累積 4 步以模擬 batch‑16)。
  • 效能 – 在 Halo 上訓練可在數小時內完成;整夜作業穩定,負載時風扇轉速提升但未見過熱情形。

誰適合考慮 Ryzen AI Halo?

  • 大型模型愛好者 – 需要在本地執行 40 B 以上開放權重模型的研究人員或開發者,尤其在隱私或離線需求重要時。
  • 多模型工作負載 – 需要同時運行多個 LLM 或 LLM 與擴散模型混合的情境。
  • 成本敏感的創作者 – 想大量產生影像或影片而不想承擔持續雲端費用的內容製作者。
  • 預算有限的自建者 – 相較於具相似效能的獨立 GPU 工作站,Halo 定價具競爭力。

限制與未來展望

  • NPU 使用率 – 目前的軟體生態系很少利用 50 TOPS NPU;未來 AMD 或第三方框架可能會解鎖其潛能。
  • 記憶體取捨 – 統一記憶體意味著必須在 CPU 與 GPU 之間平衡分配;對系統 RAM 需求大的工作負載可能需要仔細調校。
  • 超越 128 GB 的擴充 – 即將推出的 Pro 495 變體承諾最高 192 GB,進一步提升模型大小上限。

結語

AMD Ryzen AI Halo 證明統一記憶體架構可以讓極大語言模型與擴散模型的使用門檻降低。透過消除 VRAM 瓶頸並捆綁即用的軟體堆疊,它讓開發者能在本地完整執行 120 B 參數 LLM、多模型管線與整夜生成專案,且成本僅為雲端的極小一部份。


連結

Sources