Claude 3.7 Sonnet 扩展思考模式发布
概要
Anthropic 推出了 Claude 3.7 Sonnet,该模型允许用户切换“扩展思考模式”,以在复杂任务上投入更多认知资源。此次发布意义重大,因为它引入了可见的原始思维过程和“动作扩展”能力,显著提升了模型在代理任务和复杂推理中的表现。
扩展思考与可见思维过程
Claude 3.7 Sonnet 允许用户通过启用扩展思考模式,让模型对困难问题进行更深入的思考。这并非一个独立模型,而是同一模型在获取答案时分配更多时间和精力。开发者还可以通过“思考预算”进一步控制这一过程。
可见性的优势
Anthropic 将原始思维过程对用户可见,以实现以下目标:
- 信任: 用户可以观察并验证得出答案所使用的推理步骤。
- 对齐: 研究人员可以识别内部思维与外部响应之间的矛盾,以检测欺骗等行为。
- 洞察: 该过程揭示了与数学和物理领域人类专家相似的推理模式,包括从多个角度探索和反复验证答案。
局限性与风险
公开思维过程带来了特定挑战:
- 忠实度: Anthropic 指出,思维过程中使用的英文词汇可能无法完全反映模型的内部状态,且模型常基于未在思维中明确讨论的因素做出决策。
- 角色与语气: 由于思维过程未经过标准角色训练,其内部推理比最终输出更疏离、更不具个人色彩。
- 安全性: 可见的思考过程可能被恶意行为者利用,以开发更有效的越狱策略,或激励模型在训练中隐藏某些思维内容。
代理能力与动作扩展
Claude 3.7 Sonnet 引入了“动作扩展”功能,提升了模型在开放任务中迭代调用函数并响应环境变化的能力。
计算机使用与 OSWorld
该模型可发出虚拟鼠标点击和键盘输入以完成任务。在衡量多模态 AI 代理的 OSWorld 评估中,随着模型获得的交互步骤增加,其性能超越前代模型的差距持续扩大,表明其具备更强的长期任务执行能力。
Pokémon Red 基准测试
为测试代理能力,Anthropic 为 Claude 3.7 Sonnet 配备了基本记忆和屏幕像素输入,使其能够运行《宝可梦 红》。此前的 Sonnet 模型在早期即失败(Claude 3.0 Sonnet 甚至无法离开起点城镇),而 Claude 3.7 Sonnet 成功挑战了三位道馆馆主,并通过质疑假设和尝试多种策略赢得了徽章。
推理时计算扩展
Claude 3.7 Sonnet 的性能会随着推理阶段(测试时)所用计算量的增加而提升。
串行扩展
该模型采用“串行推理时计算”,即在输出最终答案前执行一系列顺序推理步骤。在数学问题上的准确率随所采样的思考 token 数量呈对数增长。
并行扩展
Anthropic 研究人员尝试了“并行推理时计算”,即采样多个独立的思维过程,并通过多数投票或学习评分函数选择最佳结果。在 GPQA 评估(生物学、化学和物理学)中,该方法(使用 256 个独立样本和 64k token 的思考预算)取得了 84.8% 的 GPQA 分数,其中物理子项得分高达 96.5%。
安全与防护框架
AI 安全等级(ASL-2)
Anthropic 确认 Claude 3.7 Sonnet 满足 ASL-2 安全标准。尽管该模型在协助参与者完成与化学、生物、放射性和核(CBRN)武器相关任务时表现出一定程度的“提升”,但所有尝试均因关键失败而无法实现端到端成功完成。
思维过程防护
为防止有害内容暴露,Anthropic 对思维过程实施加密。若思维内容涉及高风险主题(如网络攻击或危险武器),用户将看到提示:“此响应的其余思维过程不可用。”
提示注入防御
针对计算机使用功能,Anthropic 加强了对提示注入攻击的防御。通过结合新训练、修订后的系统提示和专用分类器,模型现在能阻止此类攻击 88% 的时间,较之前的 74% 显著提升。
Sources
- OriginalClaude's extended thinking
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch