Claude Fable 5.1 and Claude Mythos 5.1 Release Notes
Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1,这些模型专为高端编程、知识工作和科学研究而设计。虽然两个模型共享相同的底层架构,但它们在安全配置方面有所不同:Fable 5.1 是通用版本,而 Mythos 5.1 则仅限于网络安全和生命科学专业人士的受信任访问计划。
Cost Reductions and API Pricing
Claude Fable 5.1 显著降低了缓存读取(cache reads)的价格,将成本降低了 75%,降至每百万 token 0.25 美元。这一变化专门针对长时间运行的智能体工作流(agentic workflows),在这些工作流中,模型会频繁重新读取已处理的上下文。
- Typical Workloads: 预计与 Fable 5 相比,总体成本降低 25%。
- Agentic Workflows: 由于高频率的缓存读取,潜在节省可达 45%。
- Standard Pricing: 输入 token 保持在每百万 10 美元,输出 token 保持在每百万 50 美元。
Scientific Research and Computational Capabilities
Claude Mythos 5.1 在分子设计和计算生物学方面展示了先进的能力,其表现往往优于人类专家或现有的开源工具。
Molecular Design and Biology
在蛋白质设计中,Mythos 5.1 在设计高亲和力结合剂时,在 12 个目标中实现了近 50% 的命中率,显著高于当前蛋白质设计实践中典型的 10-15% 命中率。此外,该模型通过编写自定义 GPU 内核,优化了七个开源深度学习模型,从而实现了高达 2.5 倍的推理速度提升,并降低了 30-60% 的 GPU 成本。
Planetary Science
Claude Fable 5.1 被用于创建金星(Venus)行星三分之一的高分辨率地形图,利用了 30 年前的 NASA Magellan 雷达图像。生成的地图细节可达 2-3 公里(相比之前的 10-20 公里),并将高度精度提高了 25%。
Performance Benchmarks
Fable 5.1 在智能体科学研究和编程方面,相较于 Fable 5 和其他前沿模型表现出显著的改进。
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Agentic Coding (Terminal-Bench 4.0) | 55.8% | 42.0% | 52.3% | 37.3% |
| Knowledge Work (GDPval-AA v2) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (Partial) | 77.9% | 72.9% | 75.4% | — |
| Humanity's Last Exam (No Tools) | 60.9% | 57.8% | 56.6% | — |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
Note: Mythos 5.1 在 Terminal-Bench 4.0 上得分 60.9%。
Privacy and Enterprise Safeguards
Anthropic 正在引入 Enterprise Frontier Safeguards (EFS),这是一个提供零数据保留政策的隐私性,同时又能保持检测对抗性使用的能力。EFS 将数据存储在完全由客户控制的云基础设施中,而不是 Anthropic。
- Availability: 从 2026 年秋季开始,在 AWS、Google Cloud 和 Microsoft Azure 上分阶段推出。
- Interim Solution: 在 EFS 完全部署之前,符合条件的客户可以使用具有零数据保留功能的 Fable 5.1。
Security and Alignment
Cybersecurity and Biology Safeguards
Fable 5.1 将网络安全任务中的误报率降低了 60%,并且现在被允许出于防御目的识别软件漏洞。然而,它仍然会将双重用途任务(例如漏洞利用生成和渗透测试)重定向到 Opus 模型。在生物学领域,针对良性请求(医疗/基础生物学)的安全防护措施触发频率比 Fable 5 低 85%。
Anti-Distillation and Watermarking
为了防止模型能力的非法提取,Fable 5.1 实施了加强的抗蒸馏(anti-distillation)机制。新的 API 账户不再能够在保持模型思考过程记录(thinking transcript)的同时,在多轮对话中手动编辑先前的上下文。
此外,为了符合 EU AI Act,Anthropic 正在为文本输出实施不可见水印。目前,针对监管机构、执法部门和符合条件的组织,检测 API 正在进行私人预览版测试。
Community Insights and Counterpoints
Hacker News 上的用户和开发者提供了定性的反馈和技术批判:
Writing Style: 一些用户指出其文风很自然,较少使用陈词滥调,而另一些人则认为输出变得更加密集且不够简洁。
Endgame for Frontier Progress: 一些批评者质疑,是否基准测试(排除科学领域)的边际收益表明前沿模型进度的停滞。
Cost vs. Value: 尽管有缓存折扣,但一些开发者认为,与 DeepSeek 或 GLM 等更便宜的替代方案相比,对于通用编程智能体而言,成本仍然过高。
Technical Quirks: 用户报告说 Fable 5.1 在进行微小改动时更容易倾向于重写整个文件,这会增加 token 消耗。Anthropic 建议通过添加特定的系统提示词指令来鼓励进行“外科手术式”的精准编辑。
"In internal benchmarks, Claude Fable 5.1 solves more of our coding problems than Fable 5 or Opus 5, and achieves state of the art on trading intuition." — Craig Falls, Head of Quantitative Research, Jane Street Capital
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch