Fireworks AI Ember-1 发布
Ember-1 在不牺牲推理质量的前提下减少 Token 开销
Fireworks Research 发布了 Ember-1,这是一款专门设计的模型,旨在以比 Kimi K3 少 35% 至 50% 的 Token 提供同等质量。该模型针对智能体工作负载和自动化编码进行了优化,在这些场景中,长推理轨迹通常会增加成本和延迟,尤其是在上下文呈二次增长的多轮交互中。
Ember-1 的开发旨在解决推理模型中“过度思考”的问题。虽然像 Kimi K3 这样的模型通常会将超过 90% 的生成 Token 用于内部推理,但 Fireworks Research 发现其中大部分推理是冗余的。通过训练模型提高效率——保留关键的自我反思和错误恢复能力,同时消除无效循环——Ember-1 在显著减少 Token 占用的同时实现了相当的准确性。
训练方法与基础设施
Ember-1 使用 Fireworks Serverless Training 构建,使研究团队无需管理 GPU 配置即可快速迭代。开发过程涉及超过 50 次训练实验和 200 次评估。
为了确保 Token 节省能够适用于各种工作负载,模型在全面的任务集上进行了训练,包括:
- 数学和编码
- 指令遵循和对话
- 搜索和工具使用
- 软件工程(包括独立问题和扩展交互)
训练侧重于基于策略的规划和任务反馈引导的学习,以确保模型能够适应观察和结果,而不会退回到过度推理。
性能基准与帕累托前沿
Fireworks 使用 专业智能指数(SII) 和多个行业基准对 Ember-1 进行了评估。结果表明,Ember-1 在多个类别中建立了新的帕累托前沿——成本与性能之间的最佳平衡:
Bedside Bench(临床案例)
在 Doximity 的 Bedside Bench 上,该基准包含 500 个经医生验证的临床案例,Ember-1 在每任务成本方面优于其他模型,包括 GPT-5.6 Sol、GPT-6 Astra 和 Claude Opus 5。
行业编码基准
Ember-1 在不同推理努力设置(低、高、最大)下表现出优于 Kimi K3 的性能。在多个案例中,Ember-1 在降低成本的同时提高了通过率:
| 基准 | K3 Max 通过率 | Ember-1 通过率 | 与 K3 Max 相比的 Token/成本减少 |
|---|---|---|---|
| Terminal Bench 2.1 | 77.6% | 80.9% | -51.9% Token / -23.1 美元 |
| SWE-bench Verified | 86.0% | 93.2% | -15.5% Token / -68.1 美元 |
| SWE-Interact | 13.3% | 21.3% | -32.5% Token / -60.8 美元 |
| DeepSWE 1.1 | 62.8% | 66.4% | -23.7% Token / -126.9 美元 |
| τ-2 Bench Airline | 64% | 66% | -5.9% Token / -0.3 美元 |
实际验证与生产影响
客户 A/B 测试
在两家客户的编码工作负载实时生产测试中,Ember-1 将每任务 Token 使用量减少了约 35%,同时保持了相当的质量。这导致任务完成率和成功率的下游指标得到改善或保持稳定。
内部开发者测试
Fireworks 在内部为其开发人员的日常编码任务部署了 Ember-1。该公司报告称,该部署是“无形的”,意味着开发人员没有注意到质量下降,尽管 Token 消耗显著减少。
社区与开发者反馈
公告发布后,开发者社区就该模型的定位和可访问性提出了几点意见:
- 定价问题: 一些用户指出,虽然该模型使用更少的 Token,但每 Token 的价格可能高于基础 Kimi K3 模型,这可能会抵消部分用户的总成本节省。
- 权重可访问性: 关于模型的“开放性”存在讨论,因为 Ember-1 基于开放权重,但生成的微调模型并未以开放权重发布。
- 预填充与解码: 一些技术评论者指出,在智能体编码中,成本的很大一部分通常在于预填充(输入)而非解码(输出),而 Ember-1 的 Token 减少主要影响解码部分。
“运行 K3 最具成本效益的方式不再是让它少思考,而是运行 Ember-1,这个学会了高效思考的模型。”
Ember-1 目前作为研究预览版在 Fireworks Serverless 上提供。
Sources
- HNEmber-1
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch