Claude 3 模型系列发布
Anthropic 发布了 Claude 3 模型系列,由 Opus、Sonnet 和 Haiku 三个模型组成——旨在为智能、速度和成本提供可扩展的平衡。此次发布标志着通用智能的重大进步,引入了多模态视觉能力,并减少了整个系列中不必要的拒绝行为。
模型分层与能力
Claude 3 分为三个针对不同运营需求定制的模型:
- Claude 3 Opus: 该系列中最智能的模型,专为高度复杂的任务而设计。它在包括 MMLU(本科水平专家知识)、GPQA(研究生水平专家推理)和 GSM8K(基础数学)在内的基准测试中表现优于同行。它适用于任务自动化、研发(R&D)和高级战略分析。
- Claude 3 Sonnet: 定位于智能与速度之间的平衡。它比 Claude 2 和 2.1 快 2 倍,并针对企业级工作负载进行了优化,例如 RAG、销售自动化和代码生成。
- Claude 3 Haiku: 最快且最具成本效益的模型。它旨在为实时客户聊天、内容审核以及从非结构化数据中提取知识提供近乎即时的响应。
技术进步
视觉与多模态
所有 Claude 3 模型现在都具备先进的视觉能力,允许它们处理包括照片、图表、统计图、技术图表在内的视觉格式。这种模态专门针对那些将知识库存储在 PDF、流程图或演示文稿幻灯片中的企业用户。
准确性与幻觉减少
与 Claude 2.1 相比,Claude 3 Opus 在具有挑战性的开放式事实问题上表现出两倍的准确性提升。该模型还表现出更少的错误答案(幻觉)水平,并且在不知道答案时会更频繁地承认不确定性。
上下文窗口与召回率
该系列发布时配备了 200K 上下文窗口,尽管所有三个模型都可以为特定客户接受超过 100 万个 token 的输入。在“大海捞针”(NIAH)评估中,Claude 3 Opus 在从庞大语料库中召回信息方面实现了超过 99% 的准确率,偶尔还能识别出测试“针”是被人工插入到文本中的。
指令遵循与结构化输出
Claude 3 模型在遵循复杂、多步骤指令和品牌语调指南方面表现出更高的依从性。它们在生成结构化输出(例如 JSON)方面也更加熟练,这有助于自然语言分类和情感分析。
安全与负责任的设计
Anthropic 实施了多项安全措施以确保模型保持值得信赖:
- 拒绝率: 与前代相比,模型拒绝无害提示词(这些提示词可能接近系统护栏)的可能性显著降低。
- 偏差减少: 根据问答偏差基准测试(BBQ),Claude 3 表现出比以往模型更少的偏差。
- 安全级别: 根据 Anthropic 的负责任扩展政策,该系列仍处于 AI 安全级别 2 (ASL-2)。红队评估结论认为,这些模型带来的灾难性风险潜力微乎其微。
- Constitutional AI: 模型继续利用 Constitutional AI 来提高透明度和安全性。
价格与可用性
| Model | Input (per M tokens) | Output (per M tokens) | Context Window |
|---|---|---|---|
| Opus | $15 | $75 | 200K* |
| Sonnet | $3 | $15 | 200K |
| Haiku | $0.25 | $1.25 | 200K |
*1M tokens 可用于特定用例。
可用性: Opus 和 Sonnet 可通过 Claude API(在全球 159 个国家可用)和 claude.ai(Sonnet 对免费用户开放,Opus 对 Pro 订阅用户开放)使用。Sonnet 还可通过 Amazon Bedrock 使用,并在 Google Cloud 的 Vertex AI Model Garden 中进行私测,Opus 和 Haiku 将很快跟进。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch