M5 Ultra Mac Studio 评测:性能、成本与真实 AI 智能体应用

TL;DR

M5 Ultra Mac Studio (256 GB) 在运行本地 AI 智能体时,生成速度比 M3 Ultra 快 70%,提示词预填充(prompt pre-fill)速度快 150%。尽管在原始每秒 token 处理量上 RTX 5090 仍占优势,但 M5 Ultra 在静音效果、热设计功耗和统一内存容量方面表现更佳。该机型起售价约为 12,300–15,000 美元,对于需要保护隐私且需全天候运行 AI 助手的开发者而言,是一个极具吸引力且性价比高的平台。


为什么 M5 Ultra 对本地 AI 至关重要

本地 AI 消除了云服务费用并保护了敏感数据,但它需要强大的硬件支持。M5 Ultra 全新的 UltraFusion 四芯架构(两个 M5 Max 芯片)提供了:

  • 80 个 GPU 核心,配备神经加速器,AI 计算峰值性能是 M3 Ultra 的 4.5 倍。
  • 1.2 TB/s 的内存带宽(比 M3 Ultra 的 819 GB/s 高出约 50%)。
  • 最高 512 GB 的统一内存(评测配置为 256 GB),允许大型模型完全驻留在内存中,无需昂贵的 GPU-VRAM 卸载。

这些硬件提升直接转化为更快的智能体循环——更短的提示词处理等待时间和更高的 token 生成率——使交互式助手响应更加灵敏。


真实基准测试

生成速度 (tokens/second)

模型 提示词长度 RTX 5090 M5 Ultra M3 Ultra
Qwen-3.8-27B 8 K 59 48 31
64 K 51 39 23.5
128 K 44 32 20
256 K n/a 24 15

评论者 @simonw 强调该表格是关键数据点。

结论: 由于内存带宽更高(1.79 TB/s 对比 1.2 TB/s),RTX 5090 在原始 token 生成速度上仍然更快(领先约 25%)。然而,5090 仅限于 32 GB VRAM;超过此大小的模型需要 PCIe 卸载,这会显著降低性能。M5 Ultra 可以将 5-bit 量化的 27-B 模型完全保留在统一内存中,从而在更大的上下文窗口下保持速度。

提示词处理 (prefill) 速度

  • M5 Ultra: 比 M3 Ultra 快约 150%(约 2.5 倍提升)。
  • 影响: 发送大型系统提示词(通常 >10 K tokens)的智能体可以在几秒钟内开始响应,而不是几十秒,从而保持多轮对话的流畅性。

评论者 @srcreigh 指出,这种速度提升使得 M5 Ultra “比你在 OpenRouter 上运行的任何东西都更具成本效益”,前提是利用率足够高。

热量与声学表现

  • Mac Studio 运行起来摸上去温热,但保持静音;只有当耳朵贴近机箱时才能听到风扇噪音。
  • 相比之下,RTX 5090 的装机方案产生了明显的发热和更大的风扇噪音,尤其是在持续的高上下文工作负载下。

展示的实际用例

  1. 个人助理 – Open Minis (iOS) 和 Hermes Agent 在本地运行 Qwen-3.8-Flash-Next,即使在 64 K–256 K 上下文窗口下也能提供亚秒级的响应时间。
  2. 研究自动化 – 一个自定义的“Desk”应用编排了数十个智能体(DeepSeek V4 Flash + olmOCR),完成了为期 99 天、310 份文档的 iOS 27 评测项目,云服务费用为 $0。
  3. 编码辅助 – 将 Qwen-3.8-Flash-Next 集成到 Codex 应用中,使本地子智能体能够生成代码片段,随后由前沿云模型进行审查。
  4. 并发会话 – 使用 oMLX 0.7.0.dev2 在 256 GB M5 Ultra 上同时运行多达三个 Flash-Next 会话,证明了多用户工作负载的可行性。

与竞争硬件的对比

RTX 5090

  • 优点: 原始每秒 token 处理率更高;非常适合适合 32 GB VRAM 的小型模型。
  • 缺点: VRAM 有限,导致 >32 GB 模型必须进行卸载;物理体积更大;运行更热、更吵。

M5 Ultra

  • 优点: 统一内存消除了卸载瓶颈;静音、紧凑的外形;macOS 生态系统(界面友好,应用支持强)。
  • 缺点: 前期成本更高;纯吞吐量性能仍落后于 5090;macOS 限制了某些以 Linux 为中心的工作流。

评论者 @hamiltont 建议,对于许多用户而言,二手的 M2 Ultra 可能提供更好的投资回报率,并强调了将内存大小与工作负载相匹配的重要性。


成本视角

  • 基础价格 (256 GB): $12,299 (根据 @snarfy)。增加 4 TB SSD 和 Studio Display 后,总价接近 $15 k。
  • 按照目前的 OpenAI/Anthropic 订阅费率,同等的云算力预算每年需要 $10–$20 k,这意味着 M5 Ultra 在高强度使用 1-2 年后即可回本或更具成本优势。

评论者 @akozak 询问了硬件成本;上述价格范围直接回答了该问题。


局限性与开放性问题

  • 量化质量: MLX 的简单量化(5-bit, 6-bit)产生的模型质量可能低于 llama.cpp 风格的 QAT 训练量化。评论者 @liuliu 警告称,基准测试数字可能无法反映最终用户的质量。
  • Linux 支持: macOS 限制了某些服务器类型的部署;像 Asahi Linux 这样的社区项目仍在追赶中。评论者 @kokonokko1337 强调了这一痛点。
  • 未来扩展: 苹果宣布的 512 GB M5 Ultra(10 月下旬)可能支持 8-bit 模型而无需 SSD 卸载,进一步缩小与高端 GPU 的差距。

总结

M5 Ultra Mac Studio 将本地 AI 从一种小众且成本高昂的实验,转变为适合开发者、研究人员和追求隐私、低延迟及安静工作环境的专业用户的实用桌面设备。虽然 RTX 5090 在原始吞吐量上仍处于领先地位,但 M5 Ultra 的统一内存、卓越的热设计和 macOS 生态系统使其成为运行持久化智能体 AI 工作负载的最具吸引力的全能平台——前提是你愿意投入 12-15 k 美元的前期成本。

Sources

相关