Claude Fable 5.1 and Claude Mythos 5.1 Release Notes

Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1,这些模型专为高端编程、知识工作和科学研究而设计。虽然两个模型共享相同的底层架构,但它们在安全配置方面有所不同:Fable 5.1 是通用版本,而 Mythos 5.1 则仅限于网络安全和生命科学专业人士的受信任访问计划。

Cost Reductions and API Pricing

Claude Fable 5.1 显著降低了缓存读取(cache reads)的价格,将成本降低了 75%,降至每百万 token 0.25 美元。这一变化专门针对长时间运行的智能体工作流(agentic workflows),在这些工作流中,模型会频繁重新读取已处理的上下文。

  • Typical Workloads: 预计与 Fable 5 相比,总体成本降低 25%。
  • Agentic Workflows: 由于高频率的缓存读取,潜在节省可达 45%。
  • Standard Pricing: 输入 token 保持在每百万 10 美元,输出 token 保持在每百万 50 美元。

Scientific Research and Computational Capabilities

Claude Mythos 5.1 在分子设计和计算生物学方面展示了先进的能力,其表现往往优于人类专家或现有的开源工具。

Molecular Design and Biology

在蛋白质设计中,Mythos 5.1 在设计高亲和力结合剂时,在 12 个目标中实现了近 50% 的命中率,显著高于当前蛋白质设计实践中典型的 10-15% 命中率。此外,该模型通过编写自定义 GPU 内核,优化了七个开源深度学习模型,从而实现了高达 2.5 倍的推理速度提升,并降低了 30-60% 的 GPU 成本。

Planetary Science

Claude Fable 5.1 被用于创建金星(Venus)行星三分之一的高分辨率地形图,利用了 30 年前的 NASA Magellan 雷达图像。生成的地图细节可达 2-3 公里(相比之前的 10-20 公里),并将高度精度提高了 25%。

Performance Benchmarks

Fable 5.1 在智能体科学研究和编程方面,相较于 Fable 5 和其他前沿模型表现出显著的改进。

Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Agentic Coding (Terminal-Bench 4.0) 55.8% 42.0% 52.3% 37.3%
Knowledge Work (GDPval-AA v2) 1853 1723 1824 1711
OSWorld 2.0 (Partial) 77.9% 72.9% 75.4%
Humanity's Last Exam (No Tools) 60.9% 57.8% 56.6%
AutomationBench 31.4% 17.1% 26.9% 19.6%

Note: Mythos 5.1 在 Terminal-Bench 4.0 上得分 60.9%。

Privacy and Enterprise Safeguards

Anthropic 正在引入 Enterprise Frontier Safeguards (EFS),这是一个提供零数据保留政策的隐私性,同时又能保持检测对抗性使用的能力。EFS 将数据存储在完全由客户控制的云基础设施中,而不是 Anthropic。

  • Availability: 从 2026 年秋季开始,在 AWS、Google Cloud 和 Microsoft Azure 上分阶段推出。
  • Interim Solution: 在 EFS 完全部署之前,符合条件的客户可以使用具有零数据保留功能的 Fable 5.1。

Security and Alignment

Cybersecurity and Biology Safeguards

Fable 5.1 将网络安全任务中的误报率降低了 60%,并且现在被允许出于防御目的识别软件漏洞。然而,它仍然会将双重用途任务(例如漏洞利用生成和渗透测试)重定向到 Opus 模型。在生物学领域,针对良性请求(医疗/基础生物学)的安全防护措施触发频率比 Fable 5 低 85%。

Anti-Distillation and Watermarking

为了防止模型能力的非法提取,Fable 5.1 实施了加强的抗蒸馏(anti-distillation)机制。新的 API 账户不再能够在保持模型思考过程记录(thinking transcript)的同时,在多轮对话中手动编辑先前的上下文。

此外,为了符合 EU AI Act,Anthropic 正在为文本输出实施不可见水印。目前,针对监管机构、执法部门和符合条件的组织,检测 API 正在进行私人预览版测试。

Community Insights and Counterpoints

Hacker News 上的用户和开发者提供了定性的反馈和技术批判:

  • Writing Style: 一些用户指出其文风很自然,较少使用陈词滥调,而另一些人则认为输出变得更加密集且不够简洁。

  • Endgame for Frontier Progress: 一些批评者质疑,是否基准测试(排除科学领域)的边际收益表明前沿模型进度的停滞。

  • Cost vs. Value: 尽管有缓存折扣,但一些开发者认为,与 DeepSeek 或 GLM 等更便宜的替代方案相比,对于通用编程智能体而言,成本仍然过高。

  • Technical Quirks: 用户报告说 Fable 5.1 在进行微小改动时更容易倾向于重写整个文件,这会增加 token 消耗。Anthropic 建议通过添加特定的系统提示词指令来鼓励进行“外科手术式”的精准编辑。

"In internal benchmarks, Claude Fable 5.1 solves more of our coding problems than Fable 5 or Opus 5, and achieves state of the art on trading intuition." — Craig Falls, Head of Quantitative Research, Jane Street Capital

Sources

相关