hogeheer499-commits/strix-halo-guide

Evidence-backed AMD Strix Halo local-AI setup and benchmarks: Qwen3.8, Ollama, llama.cpp, Vulkan/ROCm, large GGUFs, and cross-OEM results.

해결하는 문제

이 프로젝트는 AMD Strix Halo / Ryzen AI MAX+ 395 시스템에서 로컬 대규모 언어 모델(LLM)을 설정하고 최적화하기 위한 포괄적이고 독립적인 기술 가이드를 제공합니다. Radeon 8060S GPU와 통합 메모리(96GB/128GB)를 고성능 AI 추론에 활용하기 위해 BIOS, OS, 드라이버를 구성하는 어려움을 해결합니다.

작동 방식

이 가이드는 Ubuntu 24.04, 메모리 관리를 위한 특정 커널 파라미터, 그리고 최신 드라이버를 설치하기 위한 kisak Mesa PPA 설치를 포함하는 단계별 설정 프로세스를 제공합니다. Ollama 및 llama.cpp와 같은 도구에서 Vulkan/RADV 백엔드를 사용하여 iGPU를 활용하고 CPU로 백업되지 않도록 합니다. 또한 사용자의 특정 요구사항(예: 속도 vs. 품질)에 따라 적절한 모델과 백엔드를 선택하는 데 도움이 되는 "최고의 알려진 프로파일"과 벤치마크의 커리레이티드 세트도 포함되어 있습니다.

대상 사용자

  • AMD Strix Halo / Ryzen AI MAX 시스템의 소유자 또는 평가자.
  • AMD 하드웨어에서 로컬 AI를 실행하고자 하는 개발자.
  • 로컬 LLM 배포를 위한 독립적이고 증거 기반의 성능 데이터를 원하는 사용자.

주요 특징

  • 자동 설정: Linux 측 Vulkan/RADV + Ollama 스택을 빠르게 배포할 수 있는 setup.sh 스크립트 포함.
  • 증거 기반 벤치마크: 모든 성능 주장이 원시 로그와 CSV에 매핑되며, Qwen 및 Gemma와 같은 모델의 테스트를 포함.
  • 용량 증명: DeepSeek V4 Flash 284B GGUF와 같은 매우 큰 모델을 실행할 수 있음을 입증.
  • 크로스-OEM 검증: 13개의 다른 시스템에서의 커뮤니티 결과를 포함하여 다양한 하드웨어 벤더 간의 이식성을 보장.
  • 코드화된 워크플로우: ROCm 7.2 Unsloth 경로를 사용하여 모델의 피니튜닝 및 내보내기의 검증된 경로 제공.

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트
  • 프로젝트