Anthropic Claude Haiku 4.5 发布:以三分之一的成本和两倍的速度实现接近前沿水平的编程性能

TL;DR

Claude Haiku 4.5 现已全面开放使用,它提供了与前沿模型 Claude Sonnet 4 相当的编程性能,而成本仅约为其三分之一,运行速度更是快了两倍以上,使其成为低延迟、成本敏感型应用的理想选择。

在小模型规模上实现接近前沿的性能

Claude Haiku 4.5 的编程质量可与 Claude Sonnet 4 相媲美,而后者在五个月前还是处于行业领先地位。在 Augment agentic coding 基准测试中,它达到了 Sonnet 4.5 性能的 90%,甚至在 computer-use 交互等特定任务上超越了 Sonnet 4。这表明,小模型现在可以在不牺牲质量与效率之间典型权衡的情况下,提供接近前沿的结果。

成本与速度优势

  • 成本: 定价为每百万输入 token 为 $1,每百万输出 token 为 $5,大约是 Sonnet 4 成本的三分之一。
  • 速度: Haiku 4.5 的运行速度比 Sonnet 4.5 快 4-5 倍,为聊天助手、客服机器人和结对编程工具提供实时响应。
  • 吞吐量: 该模型的效率扩大了在现有使用限制内可以完成的工作量,从而实现更具响应性的 AI 辅助开发工作流。

对应用的实际影响

  • Claude for Chrome: 更快的推理速度使该浏览器扩展程序在即时辅助方面更加实用。
  • Claude Code & Warp: 开发者在迭代代码时会体验到显著降低的延迟,特别是在多智能体(multi-agent)或快速原型设计场景中。
  • 智能体编排(Agentic Orchestration): Sonnet 4.5 可以将复杂问题分解为多步计划,并将子任务委派给多个 Haiku 4.5 实例,从而实现并行执行并提高整体吞吐量。

基准测试亮点

  • SWE-bench Verified: Haiku 4.5 在以极低成本运行的同时,实现了与前沿模型相当的编程性能。
  • 指令遵循(幻灯片文本生成): 准确率为 65%,而 Anthropic 的高级别模型为 44%,这表明其具有强大的通用指令遵循能力。
  • GitHub Copilot 集成: 早期测试显示,其代码生成质量与 Sonnet 4 持平,但响应时间明显更快。

"Claude Haiku 4.5 达到了一个我们认为不可能实现的平衡点:接近前沿的编程质量,同时具备极快的速度和成本效率。" – Anthropic release statement

"Claude Haiku 4.5 是智能体编程(agentic coding)的一次飞跃,特别是在子智能体编排和 computer-use 任务方面。" – Anthropic release statement

安全与对齐

  • 对齐(Alignment): 自动化评估显示,与 Claude Haiku 3.5、Sonnet 4.5 和 Opus 4.1 相比,其失配行为(misaligned behaviors)的发生率在统计学上显著降低,这使得 Haiku 4.5 成为 Anthropic 迄今为止最安全模型。
  • 风险特征: 有限的 CBRN 武器生产风险;被分类为 AI Safety Level 2 (ASL-2),限制比 Sonnet 4.5 和 Opus 4.1 的 ASL-3 评级较低。
  • 系统卡片: 完整的安全方法论和分类依据已记录在 Claude Haiku 4.5 system card

可用性与集成

  • API Access: 开发者可以通过 Claude API 使用标识符 claude-haiku-4-5 来调用该模型。
  • 云平台: 该模型可在 Amazon Bedrock 和 Google Cloud Vertex AI 上使用,可作为 Haiku 3.5 和 Sonnet 4 的即插即用替代方案,且价格最为经济。
  • Anthropic 产品: 已包含在 Claude Code、Claude for Chrome 以及其他 Anthropic 应用中。

未来方向

Claude Haiku 4.5 展示了向结合高推理能力与实时响应能力的模型的转变。Anthropic 建议,这类模型将使此前因延迟和成本限制而无法实现的新用例成为可能,例如大规模子智能体编排和交互式 AI 助手。

References

Sources

相关