AMD Ryzen AI Halo 리뷰: 128 GB Unified Memory로 120 B-Parameter 로컬 AI 구현

AMD Ryzen AI Halo 리뷰: 128 GB Unified Memory로 120 B-Parameter 로컬 AI 구현

TL;DR

AMD Ryzen AI Halo의 128 GB unified LPDDR5X memory는 최대 120 B parameters까지 훨씬 더 큰 로컬 AI 모델을 실행할 수 있게 하며, 여러 모델을 동시에 실행하여 클라우드 API 비용 없이 단일 데스크톱에서 고품질 생성형 AI를 구현할 수 있게 합니다.

Ryzen AI Halo가 다른 점은 무엇인가요?

  • Unified Memory Architecture – CPU와 GPU가 단일 128 GB pool을 공유하므로, 모델 저장용으로 대부분을 GPU에 할당할 수 있습니다. 이는 외장 GPU가 VRAM 부족으로 인해 더 느린 시스템 RAM으로 오프로딩할 때 발생하는 성능 저하를 방지합니다.
  • Chipset Specs – 이 시스템은 16 CPU cores가 탑재된 Ryzen AI Max + 395 SoC, Radeon 8060S GPU (≈60 TFLOPs FP16), 그리고 ~50 TOPS를 제공하는 NPU로 구동됩니다. 현재 LLM stack은 NPU를 거의 사용하지 않지만, 향후 소프트웨어에서 활용될 수 있습니다.
  • Scalable Memory Options – AMD는 향후 최대 192 GB memory를 지원하는 Pro 495 variant를 발표하여, 더 큰 워크로드에 대한 한계를 더 확장할 수 있도록 했습니다.

Out-of-the-Box Experience

  • Two OS Flavors – Windows edition과 Linux edition이 있습니다. Linux 버전은 ROCm, drivers, 그리고 AI tool suite가 사전 설정되어 제공되므로, 수동 드라이버 설치의 번거로움이 없습니다.
  • AMD Ryzen AI Developer Center – 시스템 소프트웨어 버전을 확인하고, GPU memory allocation을 관리하며, 사전 설치된 AI application(e.g., Llama CPP, ComfyUI)을 실행할 수 있는 중앙 UI입니다. Memory split은 기본적으로 GPU 75%로 설정되어 있으며, 언제든지 조정 가능합니다.
  • Remote Access – SSH support를 통해 Halo를 headless AI server로 취급할 수 있어, 백그라운드 추론론(inference)이나 학습(training) 작업에 이상적입니다.
  • Playbooks – 일반적인 작업에 대한 단계별 가이드(LMStudio를 이용한 LLM serving, ComfyUI를 이용한 이미지 생성, Unsloth를 이용한 fine-tuning, custom GPU kernel development)가 제공됩니다. Playbooks는 초급, 중급, 고급 사용자를 위해 분류되어 있습니다.

Large Language Model Performance

Model Type Tokens / s
Ornith 9B (dense) MTP drafter ~40
Qwen 3.6 35B MoE (3 B active) MoE + drafter >50
GPT-OSS 120B (MoE) Mixture of Experts ~30
  • Observation: 120 B parameter GPT-OSS조차도 chat이나 RAG application을 위한 적절한 30 t/s의 속도로 실행됩니다. Agent workload를 agent workload를 위해 더 작고 빠른 모델을 사용하는 것이 선호됩니다.
  • Memory Advantage: 이 모든 모델은 이전 32 GB Radeon AI Pro R9700 workstation의 제한 사항이었던 VRAM 한계에 부딪히지 않고 로드됩니다.

Image & Video Generation with ComfyUI

  • Pre-installed Models – ImageZ를 포함하며, 추가적인 모델(e.g., Qwen image model, LTX video model)을 다운로드할 수 있습니다.
  • Workflow – ComfyUI의 API를 사용하여, 저자는 다음과 같은 파이프라인을 스립트로 작성했습니다:
    1. LLM을 통해 다양한 prompt를 생성합니다.
    2. dozens of kitten-dancing images (≈19 s per image)를 렌더링합니다.
    3. LTX를 통해 짧은 영상 클립을 생성합니다.
  • Cost Efficiency – Halo를 밤새도록 실행하는 것은 전력 소모량만 발생시키며, 전형적인 독점적 서비스의 $0.10 / s 클라우드 API 비용을 피할 수 있습니다.

Running Local Agents (Hermes-Agent)

  • Setup – LMStudio를 통해 설치하며, Qwen 3.6 3.5B model을 speculative decoding (MTP)와 함께 사용합니다.
  • Capabilities – function calling, skill execution, 그리고 모델을 다시 로드하지 않고 여러 모델(e. ext{g.}, Ornith 9B, Qwen 3.6) 사이를 전환할 수 있습니다. oken_count: 3500}{

Sources