Anthropic Claude 3.5 Sonnet and Claude 3.5 Haiku 发布
Anthropic 推出了升级版的 Claude 3.5 Sonnet 以及新模型 Claude 3.5 Haiku,同时还为一项名为 "computer use" 的新能力推出了公开测试版。这项更新使 AI 模型能够像人类用户一样与计算机界面进行交互——移动光标、点击按钮和输入文本。
Computer Use: General Computer Interaction in Public Beta
Claude 3.5 Sonnet 是首个为 "computer use" 提供公开测试版的尖端 AI 模型,使其能够将高层指令转化为一系列计算机命令,从而在软件和网络中进行导航。
Technical Implementation and Performance
开发者可以集成一个 API,允许 Claude 感知并与计算机界面进行交互。在衡量人类化计算机使用能力的 OSWorld 评估中,Claude 3.5 Sonnet 在仅截图类别中获得了 14.9% 的得分,超过了排名第二的 AI 系统 7.8% 的得分。当允许更多步骤来完成任务时,其得分增加到了 22.0%。
Current Limitations and Safety
Anthropic 将该能力描述为实验性的,并指出它可能比较繁琐且容易出错。诸如滚动、拖拽和缩放等常见的人类操作对该模型来说仍然具有挑战性。为了降低与垃圾邮件、虚假信息和欺诈相关的风险,Anthropic 开发了新的分类器,以识别何时正在使用 computer use 功能以及是否正在发生伤害。
Upgraded Claude 3.5 Sonnet: Advanced Software Engineering
更新后的 Claude 3.5 Sonnet 与其前代产品相比在各方面都有所提升,在保持相同价格和速度的同时,显著增强了其智能体编码和工具使用能力。
Coding and Tool Use Benchmarks
- SWE-bench Verified: 性能从 33.4% 提高到了 49.0%,超越了所有公开可用的模型,包括像 OpenAI o1-preview 这样的推理模型。
- TAU-bench: 在零售领域,性能从 62.6% 提高到了 69.2%;在航空领域,性能从 36.0% 提高到了 46.0%。
Industry Adoption
GitLab、Cognition 和 The Browser Company 等公司报告了显著的收益。GitLab 指出,在没有增加延迟的情况下,推理能力增强了(在各种用例中最高可达 10%),而 Cognition 则观察到了在编码、规划和问题解决方面的改进。
Claude 3.5 Haiku: Speed and Affordability
Claude 3.5 Haiku 是 Anthropic 下一代速度最快的模型,旨在实现低延迟和高效率。它在许多智能基准测试中达到或超过了 Claude 3 Opus(上一代最大的模型)的性能,同时保持了与原始 Claude 3 Haiku 相似的速度。
Performance and Use Cases
Claude 3.5 Haiku 在 SWE-bench Verified 上获得了 40.6% 的得分,优于原始 Claude 3.5 Sonnet 和 GPT-4o。由于其低延迟和改进的指令遵循能力,它被优化用于面向用户的产品、专门的子智能体任务,以及处理大量数据(如库存或价格记录)。
Pricing and Availability
截至 2024 年 12 月 3 日,Claude 3.5 Haiku 的价格为每百万输入 token 0.80 美元,每百万输出 token 4.00 美元。它可通过 Anthropic API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 提供,最初作为纯文本模型提供,随后将支持图像输入。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch