Claude 2.1 发布说明
Anthropic 推出了 Claude 2.1,这是一个专为企业级应用设计的更新模型,具有显著扩展的上下文窗口、提高的事实准确性以及新的集成能力。此次发布重点在于增强模型处理海量数据集的能力,并减少错误陈述的频率,以提高商业运营中的可靠性。
200K Token 上下文窗口
Claude 2.1 将其之前的容量翻倍至 200,000 token 的上下文窗口,这大约相当于 150,000 个单词或超过 500 页的文本。这种扩展允许用户输入整个代码库、财务报表(例如 S-1s)以及长篇文学作品进行分析。
该窗口实现的关键能力包括:
- 大规模摘要生成:处理并压缩海量内容。
- 复杂问答:基于提供的广泛数据回答问题。
- 趋势预测:分析长期数据以预测模式。
- 文档对比:同时对比多个大型文档。
Anthropic 指出,处理 200K 长度的消息是行业首创,尽管完成通常需要数小时人工努力的任务可能需要几分钟时间。公司预计随着技术的演进,延迟将会降低。
幻觉率降低
与 Claude 2.0 相比,Claude 2.1 在错误陈述方面表现出 2 倍的降幅。这种“诚实度”的提升是通过一组精心挑选的复杂事实问题进行衡量的,在这些问题中,模型被评估其承认不确定性(委婉拒绝)而非提供错误主张的能力。
除了通用的诚实度外,模型在理解和摘要复杂文档(如法律和财务报告)方面也表现出特定的提升:
- 错误答案:减少了 30%。
- 错误主张:错误地得出文档支持特定主张的概率比以前的版本低 3-4 倍。
API 工具使用 (Beta)
Claude 2.1 引入了工具使用作为一项 Beta 功能,允许模型与外部 API、产品和开发者定义的函数进行集成。这使得 Claude 能够通过决定哪个工具是完成特定任务所必需的,从而代表用户编排行动。
工具使用应用的示例包括:
- 数值推理:使用计算器进行复杂的数学运算。
- API 转换:将自然语言请求转换为结构化的 API 调用。
- 信息检索:搜索数据库或使用网络搜索 API 来回答问题。
- 软件自动化:通过私有 API 在软件中执行简单的操作。
- 产品推荐:连接到数据集以协助用户完成购买。
开发者体验与系统提示词
Anthropic 更新了开发者体验,引入了 Workbench,这是一个用于迭代提示词并管理多个带有保存修订版本的项目的游乐场式环境。开发者还可以生成代码片段,以便将提示词直接集成到 SDKs 中。
此外,此次发布还引入了 system prompts,允许开发者提供自定义指令来定义 Claude 的个性、角色和响应结构,从而确保输出更加一致且可定制,并与特定用户需求保持一致。
可用性与定价
Claude 2.1 可通过 Anthropic Console 中的 API 使用,并为 claude.ai 的免费版和 Pro 版用户提供聊天体验。200K token 的上下文窗口专门为 Claude Pro 用户保留。Anthropic 还更新了其定价,以提高其模型的成本效率。
Sources
- OriginalIntroducing Claude 2.1
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch