AMD Ryzen AI Halo 评测:128 GB 统一内存实现 120 B 参数本地 AI

AMD Ryzen AI Halo 评测:128 GB 统一内存实现 120 B 参数本地 AI

TL;DR

AMD Ryzen AI Halo 的 128 GB 统一 LPDDR5X 内存让你能够运行更大的本地 AI 模型——最高可达 120 B 参数,并且可以同时运行多个模型,使得在单台桌面机器上实现高质量生成式 AI 成为可能,而无需支付云 API 的费用。

Ryzen AI Halo 有何不同?

  • 统一内存架构 – CPU 与 GPU 共享同一个 128 GB 池,你可以将大部分内存分配给 GPU 用于模型存储。这消除了离散 GPU 当显存耗尽而转向更慢系统内存时出现的性能悬崖。
  • 芯片规格 – 系统搭载 Ryzen AI Max + 395 SoC,拥有 16 核 CPU、Radeon 8060S GPU(≈60 TFLOPs FP16)以及提供约 50 TOPS 的 NPU。当前的 LLM 堆栈很少使用 NPU,但未来的软件可能会利用它。
  • 可扩展内存选项 – AMD 宣布未来将推出 Pro 495 变体,内存最高可达 192 GB,进一步提升对更大工作负载的支持上限。

开箱体验

  • 两种操作系统版本 – 提供 Windows 版和 Linux 版。Linux 版预装 ROCm、驱动以及一整套 AI 工具,免去手动安装驱动的步骤。
  • AMD Ryzen AI 开发者中心 – 集中式 UI,可查看系统软件版本、管理 GPU 内存分配、启动预装的 AI 应用(如 Llama CPP、ComfyUI)。默认内存分配为 75 % 给 GPU,随时可调。
  • 远程访问 – 支持 SSH,可将 Halo 当作无头 AI 服务器使用,适合后台推理或训练任务。
  • 使用手册 – 为常见任务提供一步步指南(使用 LMStudio 部署 LLM、使用 ComfyUI 生成图像、使用 Unsloth 微调、定制 GPU kernel 开发)。手册按初级、进阶和高级用户分类。

大语言模型性能

Model Type Tokens / s
Ornith 9B (dense) MTP drafter ~40
Qwen 3.6 35B MoE (3 B active) MoE + drafter >50
GPT‑OSS 120B (MoE) Mixture of Experts ~30
  • 观察:即使是 120 B 参数的 GPT‑OSS 也能以可用的 30 t/s 运行,足以支撑聊天或 RAG 场景。对于代理工作负载,较小、更快的模型更为合适。
  • 内存优势:所有这些模型均可加载而不触及显存上限,这在之前的 32 GB Radeon AI Pro R9700 工作站上是个限制。

使用 ComfyUI 进行图像与视频生成

  • 预装模型 – 包含 ImageZ,并支持下载额外模型(如 Qwen 图像模型、LTX 视频模型)。
  • 工作流 – 通过 ComfyUI 的 API,作者编写了以下流水线:
    1. 使用 LLM 生成多样化提示词。
    2. 渲染数十张小猫跳舞的图像(≈每张 19 秒)。
    3. 将图像输入 LTX,生成短视频片段。
  • 成本效率 – 夜间在 Halo 上运行仅消耗电费,避免了专有服务常见的 $0.10 / s 云 API 费用。

本地代理运行(Hermes‑Agent)

  • 设置 – 通过 LMStudio 安装,使用 Qwen 3.6 3.5B 模型并开启推测解码(MTP)。
  • 能力 – 支持函数调用、技能执行,并可在多个已加载模型之间切换(如 Ornith 9B、Qwen 3.6),无需重新加载。
  • 使用场景 – 24/7 本地代理每天可处理数百万 token,零 token 成本,仅受电力消耗限制。

使用 Unsloth 微调

  • 流程 – 手册自动化环境搭建、数据集下载以及对 4 B Gemma 模型的 LoRA 训练。
  • 训练技巧 – 梯度累积在显存受限的情况下实现更大的等效批量(例如累计 4 步模拟 batch‑16)。
  • 性能 – 在 Halo 上几小时即可完成训练;夜间作业稳定,负载时风扇转速提升但未出现过热现象。

谁适合考虑 Ryzen AI Halo?

  • 大模型爱好者 – 需要在本地运行 40 B 以上开源权重模型的研究者或开发者,尤其在隐私或离线需求强烈时。
  • 多模型工作负载 – 需要同时运行多个 LLM 或 LLM 与扩散模型组合的场景。
  • 成本敏感的创作者 – 想要大批量生成图像或视频而不想承担持续的云费用的内容生产者。
  • 预算有限的构建者 – 与性能相当的离散 GPU 工作站相比,Halo 的定价更具竞争力,适合大模型推理。

限制与未来展望

  • NPU 利用率 – 当前软件生态很少调用 50 TOPS NPU;未来 AMD 或第三方框架可能会解锁其潜能。
  • 内存权衡 – 统一内存意味着需要在 CPU 与 GPU 之间平衡分配;对系统内存需求大的工作负载可能需要细致调优。
  • 超越 128 GB 的扩展 – 即将推出的 Pro 495 变体承诺最高 192 GB,进一步提升模型规模上限。

最后感想

AMD Ryzen AI Halo 证明统一内存架构可以让极大语言模型和扩散模型的使用更加大众化。通过消除显存瓶颈并捆绑即用型软件栈,它让开发者能够在本地完整运行 120 B 参数 LLM、多模型流水线以及整夜的生成项目,成本仅为云端的一小部分。


链接

Sources