Claude Opus 4.6 发布说明
Anthropic 发布了 Claude Opus 4.6,这是对其最智能模型的重大升级,旨在增强智能体编码、长程规划和复杂的多学科推理能力。此次更新在测试阶段引入了 1M token 上下文窗口,并通过新的 effort 设置为开发者提供了对模型推理深度和成本的细粒度控制。
行业领先的性能与基准测试
Claude Opus 4.6 在多项高复杂度评估中处于行业领先地位,展示了在知识工作和智能体任务方面的卓越能力:
- Agentic Coding: 它在 Terminal-Bench 2.0 评估中获得了最高分。
- Multidisciplinary Reasoning: 它在 Humanity’s Last Exam 中领先于所有其他前沿模型。
- Knowledge Work: 在评估金融和法律领域表现的 GDPval-AA 上,Opus 4.6 比 OpenAI 的 GPT-5.2 高出约 144 Elo 分,比其前身 Claude Opus 4.5 高出 190 分。
- Information Retrieval: 它在 BrowseComp 上优于所有其他模型,该基准测试衡量定位难以找到的在线信息的能力。
长上下文能力与“上下文腐烂”
Opus 4.6 解决了“上下文腐烂”(long conversations 中的性能下降)问题。在 MRCR v2 needle-in-a-haystack 基准测试的 8-needle 1M 变体中,Opus 4.6 得分为 76%,显著高于 Sonnet 4.5 的 18.5%。这使得模型能够以极小的漂移在数十万 token 跨度内追踪信息,并更有效地检索埋藏的细节。
开发者技术增强
Anthropic 在 Claude Platform 上引入了多项新功能,以优化开发者实现长运行智能体并管理成本的方式:
自适应思维与 Effort 控制
开发者现在可以使用四个 effort 级别来平衡智能、速度和成本:low, medium, high (default), and max。
此外,adaptive thinking 允许模型根据上下文线索自主决定何时使用扩展思维,而不是需要一个二进制的开关。
上下文管理与输出
- Context Compaction (Beta): 为了防止智能体在执行长任务时触及上下文窗口限制,此功能在达到可配置阈值时会自动总结并替换旧的上下文。
- 1M Token Context (Beta): 这是第一个支持 1M token 窗口的 Opus 级模型。超过 200k tokens 的提示词将适用高级定价(每百万输入/输出 tokens 为 $10/$37.50)。
- 128k Output Tokens: 模型现在可以生成高达 128k tokens 的输出,减少了将大型任务拆分为多个请求的需求。
产品集成与智能体工作流
Opus 4.6 已集成到多种生产力工具中,以实现更自主的工作:
- Claude Code: 现在在研究预览版中提供“agent teams”功能,允许多个智能体并行工作并在代码库审查等任务上自主协作。
- Office Integration: Claude in Excel 已升级,可以处理多步更改和非结构化数据摄取。Claude in PowerPoint 现在处于 Max, Team, and Enterprise 计划的研究预览阶段,允许模型根据布局、字体和幻灯片母版生成演示文稿。
- Cowork: Opus 4.6 为 Cowork 研究预览版提供动力,实现跨研究、金融分析和文档创建的自主多任务处理。
安全与对齐
根据系统卡片,Opus 4.6 保持了与其它前沿模型相当或更好的安全概况。它表现出较低的失配行为率,包括欺骗和奉承,并且在最近的 Claude 模型中具有最低的过度拒绝率。
为了减轻与模型增强的网络安全能力相关的风险,Anthropic 实施了六种新的网络安全探测器以检测有害响应,并将模型的应用重点放在网络防御用途上,例如修复开源软件中的漏洞。
Sources
- OriginalClaude Opus 4.6
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch