Claude 3.7 Sonnet 扩展思考模式发布

概要

Anthropic 推出了 Claude 3.7 Sonnet,该模型允许用户切换“扩展思考模式”,以在复杂任务上投入更多认知资源。此次发布意义重大,因为它引入了可见的原始思维过程和“动作扩展”能力,显著提升了模型在代理任务和复杂推理中的表现。

扩展思考与可见思维过程

Claude 3.7 Sonnet 允许用户通过启用扩展思考模式,让模型对困难问题进行更深入的思考。这并非一个独立模型,而是同一模型在获取答案时分配更多时间和精力。开发者还可以通过“思考预算”进一步控制这一过程。

可见性的优势

Anthropic 将原始思维过程对用户可见,以实现以下目标:

  • 信任: 用户可以观察并验证得出答案所使用的推理步骤。
  • 对齐: 研究人员可以识别内部思维与外部响应之间的矛盾,以检测欺骗等行为。
  • 洞察: 该过程揭示了与数学和物理领域人类专家相似的推理模式,包括从多个角度探索和反复验证答案。

局限性与风险

公开思维过程带来了特定挑战:

  • 忠实度: Anthropic 指出,思维过程中使用的英文词汇可能无法完全反映模型的内部状态,且模型常基于未在思维中明确讨论的因素做出决策。
  • 角色与语气: 由于思维过程未经过标准角色训练,其内部推理比最终输出更疏离、更不具个人色彩。
  • 安全性: 可见的思考过程可能被恶意行为者利用,以开发更有效的越狱策略,或激励模型在训练中隐藏某些思维内容。

代理能力与动作扩展

Claude 3.7 Sonnet 引入了“动作扩展”功能,提升了模型在开放任务中迭代调用函数并响应环境变化的能力。

计算机使用与 OSWorld

该模型可发出虚拟鼠标点击和键盘输入以完成任务。在衡量多模态 AI 代理的 OSWorld 评估中,随着模型获得的交互步骤增加,其性能超越前代模型的差距持续扩大,表明其具备更强的长期任务执行能力。

Pokémon Red 基准测试

为测试代理能力,Anthropic 为 Claude 3.7 Sonnet 配备了基本记忆和屏幕像素输入,使其能够运行《宝可梦 红》。此前的 Sonnet 模型在早期即失败(Claude 3.0 Sonnet 甚至无法离开起点城镇),而 Claude 3.7 Sonnet 成功挑战了三位道馆馆主,并通过质疑假设和尝试多种策略赢得了徽章。

推理时计算扩展

Claude 3.7 Sonnet 的性能会随着推理阶段(测试时)所用计算量的增加而提升。

串行扩展

该模型采用“串行推理时计算”,即在输出最终答案前执行一系列顺序推理步骤。在数学问题上的准确率随所采样的思考 token 数量呈对数增长。

并行扩展

Anthropic 研究人员尝试了“并行推理时计算”,即采样多个独立的思维过程,并通过多数投票或学习评分函数选择最佳结果。在 GPQA 评估(生物学、化学和物理学)中,该方法(使用 256 个独立样本和 64k token 的思考预算)取得了 84.8% 的 GPQA 分数,其中物理子项得分高达 96.5%。

安全与防护框架

AI 安全等级(ASL-2)

Anthropic 确认 Claude 3.7 Sonnet 满足 ASL-2 安全标准。尽管该模型在协助参与者完成与化学、生物、放射性和核(CBRN)武器相关任务时表现出一定程度的“提升”,但所有尝试均因关键失败而无法实现端到端成功完成。

思维过程防护

为防止有害内容暴露,Anthropic 对思维过程实施加密。若思维内容涉及高风险主题(如网络攻击或危险武器),用户将看到提示:“此响应的其余思维过程不可用。”

提示注入防御

针对计算机使用功能,Anthropic 加强了对提示注入攻击的防御。通过结合新训练、修订后的系统提示和专用分类器,模型现在能阻止此类攻击 88% 的时间,较之前的 74% 显著提升。

Sources

相关