Claude 3.5 Sonnet 发布说明 / 更新内容
Anthropic 推出了 Claude 3.5 Sonnet,这是 Claude 3.5 模型家族的首个发布版本。该模型在广泛的评估中表现出超越竞争对手模型以及之前的顶级模型 Claude 3 Opus 的智能水平,同时保持了中端模型的速度和成本特性。
性能与智能基准测试
Claude 5.5 Sonnet 在研究生水平推理 (GPQA)、本科水平知识 (MMLU) 和编程能力 (HumanEval) 方面树立了新的行业基准。该模型在理解细微差别、幽默感和遵循复杂指令方面表现出显著改进,并能以自然的语气生成高质量内容。
智能体编程能力
在内部智能体编程评估中,Claude 3.5 Sonnet 解决了 64% 的问题,而 Claude 3 Opus 仅解决了 38%。这些测试衡量的是根据自然语言描述修复 bug 或为开源代码库添加功能的的能力。当配备相关工具时,该模型可以独立编写、编辑和执行代码,从而促进代码翻译和旧版应用程序迁移等任务。
速度、成本与可用性
Claude 3.5 Sonnet 的运行速度是 Claude 3 Opus 的两倍。这种性能提升与成本效益的结合使其非常适合多步工作流和上下文敏感型客户支持。
定价与技术规格:
- 输入成本: $3 每百万 token
- 输出成本: $15 每百万 token
- Context Window: 200K tokens
可用性:
- 免费访问: 可在 Claude.ai 和 Claude iOS app 上使用。
- 付费访问: Claude Pro 和 Team 计划订阅者拥有更高的速率限制。
- API/Cloud 访问: 可通过 Anthropic API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 使用。
视觉推理与视觉能力
Claude 3.5 Sonnet 是 Anthropic 迄今为止最强大的视觉模型,在标准视觉基准测试中超越了 Claude 3 Opus。该模型在视觉推理方面表现出显著改进,特别是在解释图表和图形以及从不完美的图像中准确转录文本方面。这些能力特别适用于零售、物流和金融服务行业。
Artifacts:协作式工作空间
Anthropic 在 Claude.ai 上推出了 "Artifacts" 功能,该功能将界面从对话式 AI 转换为协作式工作环境。当 Claude 生成代码片段、网站设计或文本文档时,它们会出现在对话旁边的专用窗口中。这允许用户实时查看、编辑并基于 AI 生成的内容进行构建。
安全、隐私与外部评估
根据红队测试评估,Claude 3.5 Sonnet 仍处于 AI 安全等级 2 (ASL-2)。为了确保安全,Anthropic 与英国人工智能安全研究所 (UK AISI) 进行了合作,后者进行了部署前的安全评估,并将结果与美国人工智能安全研究所 (US AISI) 进行了共享。
未来路线图
Anthropic 计划于今年晚些时候发布 Claude 3.5 Haiku 和 Claude 3.5 Opus 以完善模型家族。未来的开发包括新的模态、企业级应用集成以及允许 Claude 记住用户偏好和交互历史的 "Memory" 功能。
Sources
- OriginalIntroducing Claude 3.5 Sonnet
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch