Cerebras Inference: Qwen 3.8 27B Deployment and Performance
Cerebras 已将其模型目录扩展到包含 Qwen 3.8 27B,实现了约 1,500 tokens per second 的推理速度。此次部署利用 Cerebras 的专用硬件,为该模型的未剪枝版本提供高吞吐量访问,目标用户是那些在智能体工作流或内容生成中需要近乎瞬时输出的用户。
Model Specifications and Availability
Qwen 3.8 27B 现在可以通过 Cerebras 公共端点,通过免费试用和按需付费层级提供。该模型在平台上的技术参数包括:
- Model ID:
qwen-3.8-27b - Parameters: 27 billion
- Context Window: 免费层级用户为 64k,付费用户为 128k。
- Performance: 约 1,500 tokens per second。
Cerebras 还托管了 OpenAI GPT OSS (gpt-oss-120b),其运行速度约为 3,000 tokens per second,上下文窗口高达 131k tokens。
Hardware-Optimized Model Compression
Cerebras 保持在其公共端点上提供原始、未剪枝模型的政策,以确保架构完整性。虽然公司正在进行 Router-weighted Expert Activation Pruning (REAP) 的研究,但这些剪枝模型是通过 Hugging Face 为研究社区保留的,并不通过生产级 API 提供。
为了在不牺牲质量的情况下优化存储,Cerebras 采用了选择性的仅权重量化。权重根据层的敏感度以 16-bit、8-bit 或 4-bit 格式存储;敏感层保持全精度并进行即时反量化。所有激活值、注意力机制和 KV cache 保持未量化且为全精度。
User Performance and Cost Analysis
虽然原始的 tokens per second (t/s) 速度很高,但社区反馈强调了在生产环境中使用时的几个实际瓶颈和成本考虑:
Rate Limits and Throughput
用户报告称,公共端点的速率限制(例如,每分钟 150k 到 450k tokens)可能会成为编码任务和智能体工作流的重要阻碍。由于缓存的 tokens 也会计入这些限制,用户在长会话期间可能会迅速达到配额。
Cost vs. Speed Trade-off
Cerebras 的速度明显快于其他供应商,但成本也更高。一份用户报告指出,在 Cerebras 上的一个会话比 OpenRouter 的平均水平快 2.8 倍,但贵了 5.6 倍,这主要是因为 Cerebras 目前不对缓存的 tokens 提供价格折扣。
Utility in Software Development
关于该模型在编码方面的实用性,反馈意见不一。虽然输出速度被描述为“非常棒”,但一些用户认为,开发速度的净增益是微乎其微的,因为其他瓶颈——例如工具调用可靠性、shell 命令执行以及人类阅读输出的需求——抵消了原始推理速度。
"The net effect is that I spend about the same time waiting... at least for coding, it actually reconciles me with the 100-200t/sec you can get on DS4 or the like."
Comparison with Local Inference
一些开发者建议,对于一个 27B 参数的模型,本地推理是一个可行的替代方案。使用 ninfer 等工具,用户报告在 RTX 5090 等硬件上实现了 200-400 tokens per second,这对于许多用例来说可能已经足够,且没有 API 速率限制或持续成本的约束。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch