hogeheer499-commits/strix-halo-guide
Evidence-backed AMD Strix Halo local-AI setup and benchmarks: Qwen3.8, Ollama, llama.cpp, Vulkan/ROCm, large GGUFs, and cross-OEM results.
解决的问题
本项目为在 AMD Strix Halo / Ryzen AI MAX+ 395 系统上设置和优化本地大型语言模型(LLM)提供了一份全面且独立的技术指南。它解决了配置 BIOS、操作系统和驱动程序以充分利用 Radeon 8060S GPU 和统一内存(96GB/128GB)进行高性能 AI 推理的困难。
如何工作
该指南提供了一步一步的设置流程,包括 Ubuntu 24.04、用于内存管理的特定内核参数,以及安装 kisak Mesa PPA 以获取更新的驱动程序。它专注于使用 Vulkan/RADV 后端运行 Ollama 和 llama.cpp 等工具,确保使用 iGPU 而非回退到 CPU。此外,还包含一组精选的「最佳已知配置」和基准测试,帮助用户根据自身需求(例如速度 vs. 质量)选择合适的模型和后端。
适用人群
- AMD Strix Halo / Ryzen AI MAX 系统的所有者或评估者。
- 希望在 AMD 硬件上运行本地 AI 的开发者。
- 寻求本地 LLM 部署独立、基于证据的性能数据的用户。
主要亮点
- 自动化设置:包含
setup.sh脚本,可快速部署 Linux 端的 Vulkan/RADV + Ollama 堆栈。 - 基于证据的基准测试:将每个性能声明映射到原始日志和 CSV 文件,包括对 Qwen 和 Gemma 等模型的测试。
- 容量证明:展示了运行超大模型(如 DeepSeek V4 Flash 284B GGUF)的能力。
- 跨 OEM 验证:包含来自 13 台不同系统的社区结果,确保在不同硬件厂商间的可移植性。
- 代码化工作流:提供经验证的路径,使用 ROCm 7.2 Unsloth 路径进行模型微调和导出。
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- 项目