Databricks 集成 GPT-5.5 用于企业代理工作流

Databricks 集成 GPT-5.5 用于企业代理工作流

Databricks 将 GPT-5.5 集成到其企业代理工作流中,以提高复杂文档处理的可靠性。此集成很重要,因为 GPT-5.5 是首个在 OfficeQA Pro 基准测试中超过 50% 准确率的模型,显著减少了在遗留和扫描文档上的解析和推理错误。

OfficeQA Pro 上的最先进性能

GPT-5.5 在 OfficeQA Pro 上建立了新的最先进性能(SOTA),这是一个专门设计用于评估模型在扫描 PDF 和遗留文件上处理解析、检索和基于事实的推理的基准。在 agent-harness 设置中,与 GPT-5.4 相比,GPT-5.5 将错误减少了 46%,成为首个在此基准测试中超过 50% 准确率的模型。

根据研究工程师 Arnav Singhvi 的说法,该模型在解析较旧文档和扫描 PDF 时表现出 "阶梯式提升",而之前的模型如 GPT-5.4 常常无法正确提取数字和数字。这种解析的改进至关重要,因为这些工作流中的提取错误通常会向下游级联,从而改变代理工作的整个轨迹。

改进的编排和可靠性

除了解析之外,GPT-5.5 在多步骤任务中展示了改进的编排。虽然 GPT-5.4 偶尔会执行 "不必要的搜索绕道",导致低效的轨迹,但 GPT-5.5 在检索相关上下文和完成复杂工作流方面更可靠,且不需要额外的监督。

企业生产集成

Databricks 正通过 AI Unity Gateway 提供 GPT-5.5。客户可以在使用 AgentBricks 和 Agent Supervisor API 构建的工作流中使用该模型,其中 GPT-5.5 作为专门代理的解析、检索和执行的编排器。

正如研究工程师 Arnav Singhvi 所指出的:“GPT-5.5 在知识提升方面表现出色。就为我们进行知识工作而言,这是一个步长大小函数的变化。”

Sources