hogeheer499-commits/strix-halo-guide
Evidence-backed AMD Strix Halo local-AI setup and benchmarks: Qwen3.8, Ollama, llama.cpp, Vulkan/ROCm, large GGUFs, and cross-OEM results.
解決的問題
本專案為在 AMD Strix Halo / Ryzen AI MAX+ 395 系統上設定與最佳化本地大型語言模型(LLM)提供一份全面且獨立的技術指南。它解決了配置 BIOS、作業系統與驅動程式,以充分利用 Radeon 8060S GPU 與統一記憶體(96GB/128GB)進行高效率 AI 推論的困難。
如何運作
該指南提供逐步設定流程,包含 Ubuntu 24.04、用於記憶體管理的特定核心參數,以及安裝 kisak Mesa PPA 以取得更新驅動程式。專注於使用 Vulkan/RADV 後端執行 Ollama 和 llama.cpp 等工具,確保使用 iGPU 而非回退至 CPU。此外,還包含一組精心挑選的「最佳已知設定」與基準測試,協助使用者根據自身需求(例如速度 vs. 質量)選擇合適的模型與後端。
適用對象
- AMD Strix Halo / Ryzen AI MAX 系統的所有者或評估者。
- 希望在 AMD 硬體上執行本地 AI 的開發者。
- 尋求本地 LLM 部署之獨立、基於證據的性能資料的使用者。
主要亮點
- 自動化設定:包含
setup.sh指令碼,可快速部署 Linux 端的 Vulkan/RADV + Ollama 堆疊。 - 基於證據的基準測試:將每個效能主張對應至原始日誌與 CSV 檔案,包含對 Qwen 和 Gemma 等模型的測試。
- 容量證明:展示運行極大型模型(如 DeepSeek V4 Flash 284B GGUF)的能力。
- 跨 OEM 驗證:包含來自 13 種不同系統的社群結果,確保在不同硬體廠商間的可移植性。
- 程式化工作流程:提供經驗證的路徑,使用 ROCm 7.2 Unsloth 路徑進行模型微調與匯出。
相關
- Dispatch
- Dispatch
- Dispatch
- 專案
- 專案