Cerebras 推理:Qwen 3.8 27B 部署與效能
Cerebras 已擴展其模型目錄,納入了 Qwen 3.8 27B,實現了約每秒 1,500 個 token 的推理速度。此部署利用 Cerebras 的專用硬體,為未經剪枝(unpruned)版本的模型提供高吞吐量存取,目標對象是需要為代理工作流(agentic workflows)或內容生成提供近乎即時輸出的使用者。
模型規格與可用性
Qwen 3.8 27B 現在已透過免費試用和按需付費層級在 Cerebras 公開端點提供。該模型在平台上的技術參數包括:
- Model ID:
qwen-3.8-27b - 參數: 270 億
- 上下文窗口 (Context Window): 免費層級使用者為 64k,付費使用者為 128k。
- 效能: 約每秒 1,500 個 token。
Cerebras 同時也託管了 OpenAI GPT OSS (gpt-oss-120b),其運行速度約為每秒 3,000 個 token,上下文窗口最高可達 131k tokens。
硬體優化的模型壓縮技術
Cerebras 維持在其公開端點提供原始、未經剪枝模型的政策,以確保架構完整性。雖然該公司正在進行 Router-weighted Expert Activation Pruning (REAP) 的研究,但這些剪枝模型僅透過 Hugging Face 提供給研究社群,並不透過生產級 API 提供。
為了在不犧牲品質的情況下優化儲存,Cerebras 採用了選擇性的僅權重量化(weight-only quantization)。權重根據層的敏感度以 16-bit、8-bit 或 4-bit 格式儲存;敏感層會保持全精度並在運行時進行反量化。所有激活值(activations)、注意力機制(attention mechanisms)以及 KV cache 均保持未量化且為全精度。
使用者效能與成本分析
雖然原始的 token-per-second (t/s) 速度很高,但社群回饋強調了生產環境中使用時的幾個實際瓶頸與成本考量:
速率限制與吞吐量
使用者回饋指出,公開端點的速率限制(例如每分鐘 150k 到 450k tokens)可能會成為編碼任務和代理工作流的重要阻礙。由於快取 token 會計入這些限制,使用者在長對話期間可能會迅速達到配額。
成本與速度的權衡
比較測試顯示,Cerebras 比其他供應商明顯更快,但成本也更高。一位使用者報告指出,在 Cerebras 上的對話期間,速度比 OpenRouter 平均值快 2.8 倍,但成本高出 5.6 倍,這主要是因為 Cerebras 目前尚未針對快取 token 提供價格折扣。
在軟體開發中的實用性
關於該模型在編碼方面的實用性,回饋意見不一。雖然輸出速度被描述為「非常棒」,但一些使用者認為,開發速度的淨增益很小,因為其他瓶頸——例如工具調用(tool calling)的可靠性、shell 指令執行以及人類閱讀輸出的需求——抵消了原始的推理速度。
"對於我來說,淨效果就是我花在等待上的時間差不多一樣... 至少在編碼方面,這實際上讓我能接受與 DS4 或類似產品所能提供的 100-200t/sec 速度。"
與本地推理的比較
一些開發者建議,對於一個 27B 參數的模型,本地推理是一個可行的替代方案。使用 ninfer 等工具,使用者回饋在 RTX 5090 等硬體上可以達到 200-400 tokens per second,這在許多使用場景下可能已經足夠,且無需受限於 API 速率限制或持續性成本。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch