Netomi 将代理系统扩展到企业 – 来自 OpenAI 的经验教训

TL;DR

Netomi 宣布了一款生产级代理平台,该平台结合了用于低延迟工具使用的 GPT‑4.1 和用于深度多步骤规划的 GPT‑5.2,展示了亚 3 秒响应时间、98% 意图分类准确率以及企业级规模的内置治理。

Lesson 1 – 为真实世界复杂性而构建,而非理想化流程

结论: 企业级 AI 代理必须处理模糊的、多系统的请求,因此 Netomi 将 OpenAI 模型置于能够持久化状态、强制执行工具使用并跨步骤规划的受管编排管线的核心。

  • Netomi 的 Agentic OS 通过 GPT‑4.1 进行快速推理和工具调度来路由请求,并在需要更深层规划时通过 GPT‑5.2。
  • 平台遵循 OpenAI 推荐的提示模式:
    • 持续性提醒 在长工作流中保持 GPT‑5.2 的推理。
    • 明确的工具使用期望 通过强制 GPT‑4.1 调用权威 API 来抑制幻觉。
    • 结构化规划 利用 GPT‑5.2 概述并执行多步骤任务。
    • 代理驱动的丰富媒体决策 让 GPT‑5.2 在工具应返回图像、视频或表单时发出信号。
  • 在航空公司使用案例中,单个客户查询可能涉及票价规则检查、忠诚度福利计算、票务变更和飞行运营协调,这说明了情境感知和由情境驱动的集合架构的必要性。

“在航空公司中,情境每分钟都在变化。AI 必须推理客户所处的场景——而不仅仅是执行孤立的任务,” – Puneet Mehta, 首席执行官, Netomi。

Lesson 2 – 并行化一切以满足企业延迟期望

结论: 为了在突发负载下赢得用户信任,Netomi 并发执行模型推理和工具调用,使端到端延迟低于关键阈值。

  • 传统管线是顺序的(分类 → 检索 → 验证 → 调用工具 → 生成)。Netomi 的 并发框架 重叠这些阶段,利用 GPT‑4.1 的快速首 token 时间和稳定的流式工具调用。
  • GPT‑5.2 仅在工作流中需要深度推理的部分被调用,以防止其成为延迟瓶颈。
  • 在 DraftKings 的高峰事件期间,系统在处理 每秒超过 40,000 个并发请求 的同时保持 亚 3 秒响应,并在账户、付款、知识查询和合规检查中保持 98% 意图分类准确率

“AI 是我们在最重要时刻支持客户的核心和关键。” – Paul Liberman, 运营总裁兼联合创始人, DraftKings。

Lesson 3 – 将治理作为运行时的内在部分

结论: 可信的企业级 AI 需要将治理烘焙到执行层中,因此 Netomi 的运行时会在不确定性出现时自动验证、执行政策并安全回退。

  • 模式验证 在执行前检查每个工具调用是否符合 OpenAPI 合同。
  • 政策执行 在推理过程中内联应用主题过滤、品牌限制和合规规则。
  • PII 保护 在预处理和响应生成过程中检测并掩盖敏感数据。
  • 确定性回退 将模糊意图或低置信度预测路由到预批准的安全行为。
  • 运行时可观测性 公开令牌追踪、推理步骤和工具链日志,以便实时调试和审计。
  • 在每年处理约 200 万次提供者请求的牙科保险部署中,治理层在高容量开放注册期间防止了监管风险。

“我们构建系统时就考虑到,如果代理 ever 达到不确定性,它就会确切知道如何安全地后退。” – Puneet Mehta, 首席执行官, Netomi。

企业就绪代理系统的蓝图

结论: 将 OpenAI 的 GPT‑4.1 和 GPT‑5.2 与受管的并行执行引擎结合,可得到满足 Fortune 500 在速度、准确性和合规性方面要求的生产级代理堆栈。

  • 速度: 在极端负载下亚 3 秒延迟。
  • 准确率: 规模下 98% 意图分类。
  • 治理: 内置模式验证、政策执行、PII 保护、确定性回退和完全可观测性。
  • 可扩展性: 每秒处理超过 40k 个并发请求,覆盖航空、游戏和保险等领域。

这些原则为任何希望从原型聊天机器人过渡到可靠的企业级 AI 代理的组织提供了可重复的路线图。

一览结果

  • 高流量事件期间的亚 3 秒响应时间。
  • 规模下 98% 意图分类准确率。
  • 支持每秒超过 40,000 个并发请求的流量峰值。
  • 运行时内置治理,包含确定性回退和政策执行。
  • 成功部署于包括 United Airlines 和 DraftKings 在内的 Fortune 500 客户。

Sources