Fireworks AI Ember-1 发布

Ember-1 在不牺牲推理质量的前提下减少 Token 开销

Fireworks Research 发布了 Ember-1,这是一款专门设计的模型,旨在以比 Kimi K3 少 35% 至 50% 的 Token 提供同等质量。该模型针对智能体工作负载和自动化编码进行了优化,在这些场景中,长推理轨迹通常会增加成本和延迟,尤其是在上下文呈二次增长的多轮交互中。

Ember-1 的开发旨在解决推理模型中“过度思考”的问题。虽然像 Kimi K3 这样的模型通常会将超过 90% 的生成 Token 用于内部推理,但 Fireworks Research 发现其中大部分推理是冗余的。通过训练模型提高效率——保留关键的自我反思和错误恢复能力,同时消除无效循环——Ember-1 在显著减少 Token 占用的同时实现了相当的准确性。

训练方法与基础设施

Ember-1 使用 Fireworks Serverless Training 构建,使研究团队无需管理 GPU 配置即可快速迭代。开发过程涉及超过 50 次训练实验和 200 次评估。

为了确保 Token 节省能够适用于各种工作负载,模型在全面的任务集上进行了训练,包括:

  • 数学和编码
  • 指令遵循和对话
  • 搜索和工具使用
  • 软件工程(包括独立问题和扩展交互)

训练侧重于基于策略的规划和任务反馈引导的学习,以确保模型能够适应观察和结果,而不会退回到过度推理。

性能基准与帕累托前沿

Fireworks 使用 专业智能指数(SII) 和多个行业基准对 Ember-1 进行了评估。结果表明,Ember-1 在多个类别中建立了新的帕累托前沿——成本与性能之间的最佳平衡:

Bedside Bench(临床案例)

在 Doximity 的 Bedside Bench 上,该基准包含 500 个经医生验证的临床案例,Ember-1 在每任务成本方面优于其他模型,包括 GPT-5.6 Sol、GPT-6 Astra 和 Claude Opus 5。

行业编码基准

Ember-1 在不同推理努力设置(低、高、最大)下表现出优于 Kimi K3 的性能。在多个案例中,Ember-1 在降低成本的同时提高了通过率:

基准 K3 Max 通过率 Ember-1 通过率 与 K3 Max 相比的 Token/成本减少
Terminal Bench 2.1 77.6% 80.9% -51.9% Token / -23.1 美元
SWE-bench Verified 86.0% 93.2% -15.5% Token / -68.1 美元
SWE-Interact 13.3% 21.3% -32.5% Token / -60.8 美元
DeepSWE 1.1 62.8% 66.4% -23.7% Token / -126.9 美元
τ-2 Bench Airline 64% 66% -5.9% Token / -0.3 美元

实际验证与生产影响

客户 A/B 测试

在两家客户的编码工作负载实时生产测试中,Ember-1 将每任务 Token 使用量减少了约 35%,同时保持了相当的质量。这导致任务完成率和成功率的下游指标得到改善或保持稳定。

内部开发者测试

Fireworks 在内部为其开发人员的日常编码任务部署了 Ember-1。该公司报告称,该部署是“无形的”,意味着开发人员没有注意到质量下降,尽管 Token 消耗显著减少。

社区与开发者反馈

公告发布后,开发者社区就该模型的定位和可访问性提出了几点意见:

  • 定价问题: 一些用户指出,虽然该模型使用更少的 Token,但每 Token 的价格可能高于基础 Kimi K3 模型,这可能会抵消部分用户的总成本节省。
  • 权重可访问性: 关于模型的“开放性”存在讨论,因为 Ember-1 基于开放权重,但生成的微调模型并未以开放权重发布。
  • 预填充与解码: 一些技术评论者指出,在智能体编码中,成本的很大一部分通常在于预填充(输入)而非解码(输出),而 Ember-1 的 Token 减少主要影响解码部分。

“运行 K3 最具成本效益的方式不再是让它少思考,而是运行 Ember-1,这个学会了高效思考的模型。”

Ember-1 目前作为研究预览版在 Fireworks Serverless 上提供。

Sources

相关