Claude 4 发布说明 / 有什么新功能

Anthropic 推出了下一代 Claude 模型,Claude Opus 4Claude Sonnet 4。这些模型在编程、高级推理和 AI agent 方面树立了新的基准,并引入了混合模式,允许用户在近乎即时的响应和用于深度推理的扩展思维之间进行切换。

模型性能与基准测试

Claude Opus 4 和 Claude Sonnet 4 在软件工程和推理任务中处于行业领先地位。Opus 4 被定位为全球最佳编程模型,而 Sonnet 4 则在性能和效率之间取得了平衡。

编程与软件工程

  • SWE-bench: Claude Opus 4 实现了 72.5% 和 Claude Sonnet 4 实现了 72.7% 的 pass@1。
  • Terminal-bench: Claude Opus 4 以 43.2% 领先,显著优于其他模型。
  • Agentic Terminal Coding: 当使用 Claude Code 作为 agent 框架时,Opus 4 达到 43.2%,而 Sonnet 4 达到 35.5%。

推理与知识

  • GPQA Diamond: Opus 4 得分为 79.6%(在使用并行测试时计算的情况下为 83.3%)。
  • AIME 2025: Opus 4 实现了 75.5%(在使用并行测试时计算的情况下增加到 90.0%)。
  • MMMLU: Opus 4 得分为 88.8%,Sonnet 4 得分为 86.5%。
  • MMMU (Validation): Opus 4 得分为 76.5%,Sonnet 4 得分为 74.4%。

关键技术能力

Claude 4 引入了几项架构和功能改进,旨在增强 AI agent 的自主性和可靠性。

扩展思维与工具使用

两个模型现在都支持 extended thinking with tool use (beta)。这允许模型在内部推理和执行工具(例如网络搜索)之间交替进行,以优化其响应。此外,模型现在可以并行执行工具。

记忆与连续性

Claude Opus 4 展示了显著提高的记忆能力。当开发者授予其访问本地文件的权限时,该模型可以创建并维护“记忆文件”以提取并保存关键事实。这使得模型能够建立隐性知识并保持长期任务的连续性。

可靠性与精确度

Anthropic 降低了模型使用捷径或漏洞来完成任务的倾向。与 Sonnet 3.7 相比,Opus 4 和 Sonnet 4 在 agent 任务中的这种行为的可能性降低了 65%。

思维摘要

为了管理冗长的思维过程,Claude 4 模型使用较小的模型来压缩思维摘要。这大约应用于在思维过程过长而无法完全显示的 5% 的情况下。

Claude Code 与开发者生态系统

Claude Code 现在已正式发布,扩展了开发者在终端和 IDE 中与 AI 协作的能力。

  • IDE 集成: 为 VS Code 和 JetBrains 提供的全新 beta 扩展允许建议的编辑直接在文件内联联行显示。
  • Claude Code SDK: 一个可扩展的 SDK 允许开发者构建自定义 agent。针对 GitHub 的 beta 集成允许 Claude Code 响应 PR 反馈、修复 CI 错误并可以通过标记来修改代码。
  • API 增强: 发布了四项新 API 能力:代码执行工具、MCP connector、Files API 以及长达一小时的提示词缓存 (prompt caching)。

行业采用与反馈

几家前沿 AI 公司和平台已经集成了 Claude 4:

  • GitHub: 将引入 Claude Sonnet 4 作为 GitHub Copilot 中新编程 agent 的驱动模型。
  • Cursor: 将 Opus 4 描述为在复杂代码库理解方面的飞跃。
  • Replit: 报告称在跨多个文件的复杂更改中精度有所提高。
  • Block: 指出 Opus 4 是其 agent codename goose 中第一个在编辑和调试期间提升代码质量的模型。
  • Rakuten: 验证了 Opus 4 能够独立运行开源重构任务长达 7 小时。
  • Cognition: 表示 Opus 4 擅长解决以往模型错过的复杂挑战。

可用性与定价

Claude Opus 4 和 Sonnet 4 可通过 Claude.ai 界面、Amazon Bedrock 和 Google Cloud Vertex AI 使用。

  • 定价:
    • Opus 4: 每百万 input tokens 为 $15 / 每百万 output tokens 为 $75。
    • Sonnet 4: 每百万 input tokens 为 $3 / 每百万 output tokens 为 $15。
  • Access: Pro, Max, Team, 和 Enterprise 计划包含这两个模型。Sonnet 4 也面向免费用户提供。

Sources

相关