Claude Opus 4.8 发布说明

Anthropic 发布了 Claude Opus 4.8,这是对 Opus 4.7 的升级,改进了编程、推理和实际知识工作的基准测试。此次更新为代理任务引入了更可靠的协作伙伴,并以与其前身相同的价格立即提供。

Enhanced Model Capabilities and Reliability

Claude Opus 4.8 展示了更强的判断力和可靠性,特别是在代理和自主工作流中。根据早期测试人员和内部评估,该模型在发现自身错误并主动标记不确定性方面更加有效。

Key Performance Gains

  • Honesty and Accuracy: Opus 4.8 在其编写的代码中允许缺陷通过而不被察觉的可能性比 Opus 4.7 低约四倍。
  • Agentic Performance: 据报告,该模型是唯一一个在 Super-Agent 基准测试中端到端完成所有案例的模型,在成本持平的情况下超越了之前的 Opus 模型和 GPT-5.5。
  • Browser and Computer Use: Opus 4.8 在 Online-Mind2Web 上获得了 84% 的得分,表现优于 Opus 4.7 和 GPT-5.5。
  • Legal and Professional Work: 该模型在 Legal Agent Benchmark 上取得了已记录的最高分,成为第一个在全通过标准上超过 10% 的模型。

Industry Feedback

行业合作伙伴强调了特定的操作改进:

  • Databricks: 报告称其 Genie AI 代理实现了“代理推理的阶跃式变化”,在非结构化内容上的多模态推理的 token 成本比 Opus 4.7 便宜 61%。
  • Devin: 指出 Opus 4.8 修复了 Opus 4.7 中发现的注释冗余和工具调用问题,从而实现了更一致的无人值守自主工程。
  • Hebbia: 观察到在金融文档工作流中,检索的引用精度和 token 效率得到了提升。
  • Cursor: 报告称工具调用更加高效,在达到相同智能水平的情况下所需的步骤更少。

New Features and Tooling

除了模型发布外,Anthropic 还引入了几项功能,以让用户对模型行为和规模进行更多控制。

Dynamic Workflows in Claude Code

在 Enterprise、Team 和 Max 计划中以研究预览版形式提供,动态工作流允许 Claude 通过规划工作并在单个会话中运行数百个并行子代理来管理大规模问题。这使得代码库规模的迁移能够从启动到合并完成,跨越数十万行代码。

Effort Control

用户在 claude.ai 和 Cowork 上现在可以选择 Claude 在响应中投入的精力:

  • High Effort (Default): 平衡质量和用户体验;在编程任务上比 Opus 4.7 的默认设置表现更好,同时使用相似的 token。
  • Extra/Max Effort: 模型会花费更多 token 以获得更好的结果,建议用于困难任务和长时间运行的异步工作流。
  • Low Effort: 更快的响应,消耗速率限制的速度更慢。

Messages API Update

Messages API 现在支持在 messages 数组内部进行 system entries。这允许开发者在任务中途更新指令、权限、token 预算或环境上下文,而不会破坏 prompt cache 或需要用户介入。

Alignment and Safety

Opus 4.8 经过了详细的对齐评估。Anthropic 对齐团队发现,该模型在亲社会特征方面达到了“新高”,特别是在支持用户自主权和以用户的最佳利益行事方面。不符合对齐要求的行为(包括欺骗或配合滥用)的发生率显著低于 Opus 4.7,并与 Claude Mythos Preview 模型相当。

Pricing and Availability

Claude Opus 4.8 可通过 Claude API (claude-opus-4-8) 和 claude.ai 获取。

Mode Input Price (per M tokens) Output Price (per M tokens)
Regular $5 $25
Fast Mode (2.5x speed) $10 $50

Opus 4.8 的快速模式比之前模型的快速模式便宜三倍。

Future Roadmap

Anthropic 正在致力于两个主要方向:以更低的成本开发 Opus 级别的能力,以及创建一类新的更高智能的模型。作为 Project Glasswing 的一部分,公司目前正在测试 Claude Mythos Preview 用于网络安全工作,并预计在实施必要的网络安全防护措施后,在未来几周内将 Mythos 级模型带给所有客户。

Sources

相关