Anthropic 恢复对 Claude Fable 5 和 Mythos 5 的访问
TL;DR
Anthropic 在美国出口管制解除后,已恢复对 Claude Fable 5 和 Claude Mythos 5 的全球访问,并引入了更严格的安全分类器、一项提议的行业级越狱严重性框架,以及与美国政府的更深入合作。
立即可用性与使用条款
- Claude Fable 5 于 7 月 1 日起在 Claude Platform、Claude.ai、Claude Code 和 Claude Cowork 上可用。对于 Pro、Max、Team 及部分企业计划,该模型在 7 月 7 日前可计入每周使用限额的最高 50 %;此后需通过使用积分访问。
- Claude Mythos 5 在美国政府于 6 月 26 日批准后,已恢复对一组美国组织的访问。在主要云服务商(AWS、Google Cloud、Microsoft Foundry)上的访问将尽快重新启用。
- 两个模型共享相同的底层架构;Fable 5 发布时配备了最强的安全防护,而 Mythos 5 最初仅限于受信任的 Project Glasswing 合作伙伴用于防御性网络安全工作。
事件时间线与安全增强措施
| 日期 | 事件 |
|---|---|
| 6 月 9 日 | 发布 Claude Fable 5 和 Claude Mythos 5。 |
| 6 月 12 日 | 美国政府在亚马逊报告一起绕过行为后实施出口管制,该行为使 Fable 5 能枚举软件漏洞,甚至在某些情况下生成利用代码。 |
| 6 月 12 日 – 6 月 30 日 | Anthropic 与政府及合作伙伴合作,审查报告、测试其他模型,并开发新的安全分类器。 |
| 6 月 30 日 | 出口管制解除(来源:Howard Lutnick 在 X 上的推文)。 |
| 7 月 1 日 | Fable 5 全球重新部署;Mythos 5 在美国有限重新部署。 |
关键安全更新:新的安全分类器在超过 99 % 的尝试中阻止了亚马逊报告中描述的特定技术。当请求被阻止时,用户将收到通知,并且查询将被重定向至 Opus 4.8。该分类器会增加对良性编码/调试任务的误报率,但 Anthropic 接受这一权衡以保持较大的安全余量。
Anthropic 的网络安全防护策略
- 纵深防御:多层防护——模型级拒绝训练、事后滥用分析和专用分类器——协同工作以防止危险行为。
- 安全分类器:小型 AI 系统,用于标记可能涉及有害网络安全行为的请求。对于 Fable 5,安全余量被有意设得较大,导致部分良性请求被拦截,以确保真正危险的请求几乎不会被遗漏。
- 分类器行为图示(摘录):
- A 行 – 基线分类器行为。
- B 行 – Fable 5 扩展的安全余量,拦截更多良性请求,但减少被遗漏的有害案例。
- C–E 行 – 展示轻微、狭窄和普遍越狱如何与安全余量相互作用。
- 越狱韧性:轻微越狱可能绕过分类器,但仍处于安全余量内,限制潜在危害。狭窄的有害越狱较为罕见;截至本文撰写时,尚未观察到 Fable 5 的普遍越狱。
- 持续优化:Anthropic 将继续调整分类器,在减少误报的同时保持对进攻性网络能力的强大防护。
提议的行业级 AI 越狱严重性框架
Anthropic 与亚马逊、微软、谷歌及其他 Glasswing 合作伙伴共同起草了一项共识性评分标准,用于从四个维度对越狱进行分级:
- 能力提升 – 越狱相较于现有工具的推进程度。
- 能力提升的广度 – 越狱可启用的独立进攻任务数量。
- 武器化难度 – 将越狱转化为攻击所需的人工努力程度。
- 可发现性 – 该技术被发现和复用的难易程度。
该框架旨在标准化与政府的沟通,并优先安排缓解措施。
- 响应分级:最严重类别(例如可能危及关键基础设施的越狱)将触发立即部署缓解措施和 24/7 监控。
- 社区参与:Anthropic 已启动 HackerOne 计划,供研究人员提交 Fable 5 中的网络越狱发现。
与美国政府的深化合作
Anthropic 列出了四项具体承诺,以扩展其与联邦机构的合作:
- 发布前访问 – 指定政府合作伙伴可提前获取模型和安全防护,用于独立评估。
- 快速共享安全防护 – 重大越狱或滥用模式将被迅速报告,并分享新缓解措施供独立测试。
- 专属联合研究资源 – Anthropic 将分配计算资源和人员,支持政府主导的 AI 安全研究。
- 行业通用安全标准 – 与政府及同行合作,制定自愿性的跨行业安全与评估标准。
这些举措符合 6 月 2 日发布的《促进先进人工智能创新与安全行政命令》,旨在建立一个透明、持久的流程,用于发布强大的前沿模型。
对用户和 AI 生态系统的影响
- 对开发者:Fable 5 的高级功能访问已恢复,但用户在常规编码任务中可能偶尔遇到请求被拦截的情况。
- 对安全研究人员:新的 HackerOne 计划提供了清晰的渠道报告越狱,承诺快速缓解。
- 对政策制定者:Anthropic 的框架与政府合作为行业如何自我监管并配合监管机构提供了具体范例。
- 对更广泛的 AI 社区:推动建立共享的越狱严重性分类法,可能成为事实标准,降低在发现新型模型绕过技术时的不确定性。
相关公告
- 提升 Fable 5 的生物学防护 – 详见 Anthropic 的后续文章。
- Mariano‑Florentino (Tino) Cuéllar 加入 Anthropic 担任首席全球事务官 – 扩展公司政策与合作能力。
Sources
- OriginalRedeploying Claude Fable 5
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch