Netomi 將代理系統擴展至企業規模 – 從 OpenAI 獲得的經驗教訓

TL;DR

Netomi 宣布推出生產級代理平台,結合了用於低延遲工具使用的 GPT-4.1 與用於深度多步驟規劃的 GPT-5.2,展示了低於 3 秒的響應時間、98% 的意圖分類準確度,以及企業級規模的內建治理功能。

教訓 1 – 為現實世界的複雜性而建,而非理想化的流程

結論: 企業級 AI 代理必須處理模糊且涉及多系統的請求,因此 Netomi 將 OpenAI 模型置於受治理的編排管線核心,該管線可以維持狀態、強制執行工具使用,並進行跨步驟規劃。

  • Netomi 的 Agentic OS 會透過 GPT-4.1 進行快速推理與工具調用,並在需要更深層規劃時透過 GPT-5.2 進行處理。
  • 該平台遵循 OpenAI 建議的提示詞模式:
    • Persistence reminders(持久化提醒)在長工作流中維持 GPT-5.2 的推理能力。
    • Explicit tool-use expectations(明確的工具使用預期)透過強制 GPT-4.1 調用權威 API,來抑制幻覺。
    • Structured planning(結構化規劃)利用 GPT-5.2 來概述並執行多步驟任務。
    • Agent-driven rich-media decisions(代理驅動的豐富媒體決策)讓 GPT-5.2 能夠發出訊號,指示何時應返回圖像、影片或表單。
  • 在航空公司案例中,單一客戶查詢可能涉及票價規則檢查、忠誠度福利計算、機票變更以及航班營運協調,這說明了對情境感知與以上下文為導向的集成架構的需求。

“在航空公司,情境每分鐘都在變化。AI 必須對客戶所處的情境進行推理——而不僅僅是執行單一任務,” – Puneet Mehta, CEO, Netomi.

教訓 2 – 並行化一切以滿足企業級延遲預期

結論: 為了在突發負載下贏得用戶信任,Netomi 同時執行模型推理與工具調用,將端到端延遲保持在關鍵閾值以下。

  • 傳統管線是順序式的(分類 → 檢索 → 驗證 → 調用工具 → 生成)。Netomi 的 concurrency framework(並行框架)重疊了這些階段,利用了 GPT-4.1 的快速首字生成時間(time-to-first-token)與穩定的串流工具調用。
  • GPT-5.2 僅在工作流中需要深度推理的部分被調用,以防止其成為延遲瓶頸。
  • 在 DraftKings 的高峰事件期間,系統在處理 >40,000 每秒並行請求 的同時,維持了 低於 3 秒的響應時間,並在帳戶、支付、知識檢索與法規檢查方面保持了 98% 的意圖分類準確度

“AI 對於我們在最關鍵時刻支援客戶的方式至關重要且核心。” – Paul Liberman, Co-Founder & President of Operations, DraftKings.

教訓 3 – 將治理納入運行時的核心部分

結論: 可信賴的企業級 AI 需要將治理嵌入到執行層中,因此 Netomi 的運行時自動進行驗證、執行政策並在出現不確定性時安全地回退。

  • Schema validation(架構驗證)在執行前檢查每個工具調用是否符合 OpenAPI 合約。
  • Policy enforcement(政策執行)在推理過程中即時應用主題過濾、品牌限制與合規性規則。
  • PII protection(個人識別資訊保護)在預處理與響應生成期間檢測並遮蔽敏感數據。
  • Deterministic fallback(確定性回退)將模糊的意圖或低置信度的預測路由至預先核准的安全行為。
  • Runtime observability(運行時可觀測性)提供 Token 追蹤、推理步驟與工具鏈日誌,以便進行即時除錯與審計。
  • 在每年處理約 200 萬次服務商請求的牙科保險部署中,治理層防止了在高流量開放註冊期間的法規風險。

“我們建立這個系統,是為了讓代理在遇到不確定性時,能精確地知道如何安全地退後一步。” – Puneet Mehta, CEO, Netomi.

企業級就緒代理系統的藍圖

結論: 將 OpenAI 的 GPT-4.1 與 GPT-5.2 結合,並搭配受治理的並行執行引擎,可產生生產級的代理技術棧,滿足 Fortune 500 強企業對速度、準確度與合規性的要求。

  • 速度: 極端負載下的低於 3 秒延遲。
  • 準確度: 大規模規模下的 98% 意圖分類準確度。
  • 治理: 內建的架構驗證、政策執行、PII 保護、確定性回退與完整的可觀測性。
  • 擴展性: 在航空公司、遊戲與保險等領域處理 >40,000 每秒並行請求。

這些原則為任何尋求從原型聊天機器人轉向可靠、企業級 AI 代理的組織提供了一條可重複的路線圖。

結果一覽

  • 高流量事件期間的低於 3 秒響應時間。
  • 大規模規模下的 98% 意圖分類準確度。
  • 支援超過 40,000 每秒並行請求的流量高峰。
  • 治理嵌入在運行時中,具備確定性回退與政策執行功能。
  • 成功為 Fortune 500 強企業客戶(包括 United Airlines 與 DraftKings)進行部署。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 專案