hogeheer499-commits/strix-halo-guide

Evidence-backed AMD Strix Halo local-AI setup and benchmarks: Qwen3.8, Ollama, llama.cpp, Vulkan/ROCm, large GGUFs, and cross-OEM results.

解決的問題

本專案為在 AMD Strix Halo / Ryzen AI MAX+ 395 系統上設定與最佳化本地大型語言模型(LLM)提供一份全面且獨立的技術指南。它解決了配置 BIOS、作業系統與驅動程式,以充分利用 Radeon 8060S GPU 與統一記憶體(96GB/128GB)進行高效率 AI 推論的困難。

如何運作

該指南提供逐步設定流程,包含 Ubuntu 24.04、用於記憶體管理的特定核心參數,以及安裝 kisak Mesa PPA 以取得更新驅動程式。專注於使用 Vulkan/RADV 後端執行 Ollama 和 llama.cpp 等工具,確保使用 iGPU 而非回退至 CPU。此外,還包含一組精心挑選的「最佳已知設定」與基準測試,協助使用者根據自身需求(例如速度 vs. 質量)選擇合適的模型與後端。

適用對象

  • AMD Strix Halo / Ryzen AI MAX 系統的所有者或評估者。
  • 希望在 AMD 硬體上執行本地 AI 的開發者。
  • 尋求本地 LLM 部署之獨立、基於證據的性能資料的使用者。

主要亮點

  • 自動化設定:包含 setup.sh 指令碼,可快速部署 Linux 端的 Vulkan/RADV + Ollama 堆疊。
  • 基於證據的基準測試:將每個效能主張對應至原始日誌與 CSV 檔案,包含對 Qwen 和 Gemma 等模型的測試。
  • 容量證明:展示運行極大型模型(如 DeepSeek V4 Flash 284B GGUF)的能力。
  • 跨 OEM 驗證:包含來自 13 種不同系統的社群結果,確保在不同硬體廠商間的可移植性。
  • 程式化工作流程:提供經驗證的路徑,使用 ROCm 7.2 Unsloth 路徑進行模型微調與匯出。

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • 專案
  • 專案