Claude 2 发布说明
Anthropic 已宣布发布 Claude 2,这是一款新模型,其在推理、编码和安全性方面均有显著提升,并且上下文窗口大幅扩展。此次更新使模型能够处理数百页的技术文档,并在单次输出中生成更长的文档。
扩展的上下文和输出能力
Claude 2 支持每条提示最多 100K 个标记的输入容量。这一扩展的上下文窗口使模型能够在单次交互中分析大型数据集,例如整本书或全面的技术文档。此外,该模型现在可以生成更长的输出,包括跨越数千个标记的故事、信件和备忘录。
性能基准与技术改进
与前代模型 Claude 1.3 相比,Claude 2 在推理、数学和编码方面表现出可衡量的提升:
- 法律推理: Claude 2 在律师资格考试的多选题部分得分为 76.5%,高于前代的 73.0%。
- 编码: 在 Codex HumanEval Python 编码测试中,Claude 2 得分为 71.2%,高于前代的 56.0%。
- 数学: 在 GSM8k 小学数学问题集上,该模型得分为 88.0%,而 Claude 1.3 为 85.2%。
- 学术测试: 与研究生申请者相比,Claude 2 在 GRE 阅读和写作考试中的得分超过第 90 百分位,定量推理部分表现与中位申请者相当。
安全性与无害性
Anthropic 已实施迭代式安全改进,使 Claude 2 对有害或危险输出更具抵抗力。根据内部红队评估,使用自动化测试和对代表性有害提示集的手动检查,Claude 2 提供无害响应的能力是 Claude 1.3 的 2 倍。这些改进源于广泛的红队测试以及专门设计的安全技术,旨在降低越狱的可能性。
可用性与集成
Claude 2 通过 API 向企业用户提供,价格与 Claude 1.3 相同。它还驱动了面向公众的 beta 聊天体验,可在 claude.ai 上使用,目前对美国和英国用户开放。
企业合作
已有两家关键合作伙伴将 Claude 2 集成到其平台中:
- Jasper: 生成式 AI 平台利用 Claude 2 实现长文本、低延迟的用例,借助 3 倍更大的上下文窗口,实现现有内容的重混,并提升复杂提示的推理能力。
- Sourcegraph: 编码助手 Cody 使用 Claude 2,通过 100K 上下文窗口传递更多代码库上下文,提供更准确的答案。Cody 还受益于 Claude 2 基于更新数据的训练,从而掌握更新的框架和库知识。
Sources
- OriginalClaude 2
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch