Claude 3.7 Sonnet and Claude Code Release

Anthropic 宣布推出 Claude 3.7 Sonnet,这是首款混合推理模型,将标准 LLM 能力与扩展的、逐步思考的能力集成到单个模型中。此次发布引入了一种统一的推理方法,允许用户在即时响应和深度反思之间进行选择,以提高处理复杂技术任务时的性能。

Claude 3.7 Sonnet: Hybrid Reasoning Capabilities

Claude 3.7 Sonnet 既可以作为标准 LLM 使用,也可以作为推理模型使用。在标准模式下,它是 Claude 3.5 Sonnet 的升级版本。在扩展思考模式下,模型在回答之前会进行自我反思,从而增强了其在数学、物理、编程和指令遵循方面的性能。

推理系统的关键技术特性包括:

  • Visible Thinking: 模型逐步推理的过程对用户可见。
  • Controllable Thinking Budgets: API 用户可以指定思考预算(最高可达 128K tokens),从而允许他们在响应速度和成本之间进行权衡,以换取更高的回答质量。
  • Real-World Optimization: Anthropic 将重点从竞赛风格的数学和计算机科学问题转向反映实际业务用例的现实世界任务。

Performance and Benchmarks

Claude 3.7 Sonnet 在两个主要基准测试中实现了最先进的性能:

  • SWE-bench Verified: 评估模型解决现实世界软件问题的能力。
  • TAU-bench: 测试 AI agent 在涉及用户和工具交互的复杂现实世界任务中的表现。

来自行业合作伙伴的早期测试表明,其在编程方面的效率极高。Cursor 报告称,该模型在处理现实世界编程任务和复杂代码库时表现为同类最佳。Cognition 指出其在代码变更和全栈更新方面的规划能力更优。Vercel 强调了其在复杂 agent 工作流中的精准度,而 Replit 使用该模型从头开始构建复杂的 Web 应用。Canva 报告称其生成的生产级代码错误更少,且具有更出色的设计品味。

Claude Code: Agentic Coding Tool

除了模型之外,Anthropic 还推出了 Claude Code,这是一个目前处于有限研究预览阶段的命令行工具。Claude Code 作为一个主动协作工具,可以:

  • 搜索并阅读代码。
  • 编辑文件并运行测试。
  • 将代码提交并推送到 GitHub。
  • 使用命令行工具。

Anthropic 报告称,在早期测试中,Claude Code 能够单次完成此前需要超过 45 分钟手动操作的任务。

Availability and Pricing

Claude 3.7 Sonnet 可通过所有 Claude 计划(Free, Pro, Team, 和 Enterprise)使用,也可通过 Claude Developer Platform、Amazon Bedrock 和 Google Cloud's Vertex AI 使用。除了免费层级外,所有平台均提供扩展思考模式。

定价保持与之前版本一致:

  • Input tokens: $3 per million tokens.
  • Output tokens: $15 per million tokens (including thinking tokens).

Safety and Reliability

与前代产品相比,Claude 3.7 Sonnet 将不必要的拒绝率降低了 45%,能够对有害请求和良性请求做出更细致的区分。此次发布还附带了一份系统卡片,详细说明了负责任的扩展政策(Responsible Scaling Policy)评估,并解决了与计算机使用相关的风险,例如提示词注入攻击(prompt injection attacks)。

Sources

相关