M5 Ultra Mac Studio 評測:效能、成本與真實 AI 代理使用體驗
總結 (TL;DR)
M5 Ultra Mac Studio (256 GB) 在執行本地 AI 代理時,生成速度比 M3 Ultra 快達 70 %,提示詞預填充 (prompt pre‑fill) 速度快達 150 %。儘管在原始每秒 Token 吞吐量上 RTX 5090 仍佔優勢,但 M5 Ultra 在靜音表現、散熱設計與統一記憶體容量方面表現更佳。對於需要隱私保護且需全天候運作 AI 助理的開發者而言,這台機器以約 12,300 至 15,000 美元的起售價,是一個極具吸引力且符合成本效益的平台。
為何 M5 Ultra 對本地 AI 至關重要
本地 AI 消除了雲端服務費用並保護了敏感數據,但它需要強大的硬體支援。M5 Ultra 全新的 UltraFusion 四晶片架構(兩個 M5 Max 晶片)提供了:
- 80 個 GPU 核心,配備神經加速器,AI 運算峰值達到 M3 Ultra 的 4.5 倍。
- 1.2 TB/s 的記憶體頻寬(約比 M3 Ultra 的 819 GB/s 高出 50 %)。
- 高達 512 GB 的統一記憶體(評測配置為 256 GB),允許大型模型完全保留在 RAM 中,無需進行昂貴的 GPU‑VRAM 卸載。
這些硬體提升直接轉化為更快的代理迴圈——縮短了提示詞處理的等待時間並提高了 Token 生成速率,使互動式助理的操作感更加流暢。
真實基準測試
生成速度 (tokens/second)
| 模型 | 提示詞大小 | RTX 5090 | M5 Ultra | M3 Ultra |
|---|---|---|---|---|
| Qwen‑3.8‑27B | 8 K | 59 | 48 | 31 |
| 64 K | 51 | 39 | 23.5 | |
| 128 K | 44 | 32 | 20 | |
| 256 K | n/a | 24 | 15 |
評論者 @simonw 強調此表格為關鍵數據點。
結論: 由於記憶體頻寬較高 (1.79 TB/s 對比 1.2 TB/s),RTX 5090 在原始 Token 生成速度上仍然較快(領先約 25 %)。然而,5090 受限於 32 GB VRAM;超過此大小的模型需要 PCIe 卸載,這會大幅降低效能。M5 Ultra 可以將 5‑bit 量化的 27‑B 模型完全保留在統一記憶體中,從而在更大的上下文視窗中保持速度。
提示詞處理 (prefill) 速度
- M5 Ultra:比 M3 Ultra 快約 150 %(約 2.5 倍提升)。
- 影響:發送大型系統提示詞(通常 >10 K tokens)的代理可以在幾秒鐘內開始回應,而不是幾十秒,從而保持多輪對話的流暢性。
評論者 @srcreigh 指出,這種速度提升使得 M5 Ultra 「比你在 OpenRouter 上能執行的任何東西都更具成本效益」,前提是利用率足夠高。
散熱與噪音表現
- Mac Studio 運作時摸起來溫熱,但保持安靜;只有將耳朵貼近機殼時才能聽到風扇聲。
- 相比之下,RTX 5090 組裝機在持續高上下文負載下會產生明顯的熱量與較大的風扇噪音。
實際應用案例展示
- 個人助理 – Open Minis (iOS) 與 Hermes Agent 在本地執行 Qwen‑3.8‑Flash‑Next,即使在 64 K–256 K 上下文視窗下也能提供亞秒級的回應速度。
- 研究自動化 – 一個自訂的「Desk」應用程式編排了數十個代理(DeepSeek V4 Flash + olmOCR),用於進行為期 99 天、310 份文件的 iOS 27 審查專案,雲端費用為 $0。
- 程式碼輔助 – 將 Qwen‑3.8‑Flash‑Next 整合到 Codex 應用程式中,使本地子代理能夠生成程式碼片段,隨後由前沿雲端模型進行審查。
- 並發工作階段 – 使用 oMLX 0.7.0.dev2 在 256 GB M5 Ultra 上同時執行多達三個 Flash‑Next 子代理工作階段,證明了多使用者工作負載的可行性。
與競爭硬體的比較
RTX 5090
- 優點:原始每秒 Token 速率更高;非常適合適合 32 GB VRAM 的小型模型。
- 缺點:VRAM 有限,導致 >32 GB 模型必須進行卸載;體積較大;運作時更吵、更熱。
M5 Ultra
- 優點:統一記憶體消除了卸載瓶頸;安靜、緊湊的機身設計;macOS 生態系統(介面優美、應用程式支援強大)。
- 缺點:前期成本較高;在純吞吐量上效能仍落後於 5090;macOS 限制了某些以 Linux 為中心的工作流程。
評論者 @hamiltont 建議,對於許多使用者而言,二手 M2 Ultra 可能提供更好的投資報酬率,並強調了將 RAM 大小與工作負載相匹配的重要性。
成本觀點
- 基本價格 (256 GB):$12,299 (根據 @snarfy)。加上 4‑TB SSD 與 Studio Display,總價將推向 $15,000 左右。
- 以目前的 OpenAI/Anthropic 訂閱費率計算,相當的雲端運算預算每年需花費 $10,000–$20,000,這使得 M5 Ultra 在高強度使用 1–2 年後,成為一個損益平衡甚至更便宜的解決方案。
評論者 @akozak 詢問了硬體成本;上述價格範圍直接回答了該問題。
限制與待解問題
- 量化品質:MLX 的簡單量化(5‑bit, 6‑bit)產生的模型品質可能低於 llama.cpp 風格的 QAT 訓練量化。評論者 @liuliu 警告基準測試數字可能無法反映終端使用者的品質。
- Linux 支援:macOS 限制了某些伺服器類型的部署;像 Asahi Linux 這樣的社群努力仍在追趕中。評論者 @kokonokko1337 強調了這個痛點。
- 未來擴展:蘋果宣佈的 512 GB M5 Ultra(10 月下旬)可能實現 8‑bit 模型而無需 SSD 卸載,進一步縮小與高階 GPU 的差距。
總結
M5 Ultra Mac Studio 將本地 AI 從一個小眾且成本高昂的實驗,轉變為開發者、研究人員與追求隱私、低延遲及安靜工作空間的進階使用者所使用的實用桌面設備。儘管 RTX 5090 在原始吞吐量上仍處於領先地位,但 M5 Ultra 的統一記憶體、卓越的散熱設計與 macOS 生態系統,使其成為執行持續性代理 AI 工作負載最引人注目的多合一平台——前提是你願意投入 12,000 至 15,000 美元的前期成本。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch