Netomiによるエージェンティック・システムのエンタープライズ展開 – OpenAIからの教訓

TL;DR

Netomiは、低レイテンシのツール利用のためのGPT‑4.1と、深いマルチステップの計画のためのGPT‑5.2を組み合わせた、プロダクショングレードのエージェンティック・プラットフォームを発表しました。これは、3秒未満のレスポンスタイム、98%の意図分類精度、およびエンタープライズ規模での組み込みガバナンスを実現しています。

レッスン 1 – 理想化されたフローではなく、現実世界の複雑さに対応する

結論: エンタープライズAIエージェントは、曖昧でマルチシステムの要求を処理できなければなりません。そのため、NetomiはOpenAIのモデルを、状態を保持し、ツール利用を強制し、ステップ間で計画を立てることができる、ガバナンスの効いたオーケストレーション・パイプラインの中核に配置しています。

  • Netomiの Agentic OS は、高速な推論とツール呼び出しのためにGPT‑4.1を、より深い計画が必要な場合にはGPT‑5.2を介してリクエストをルーティングします。
  • プラットフォームは、OpenAIが推奨するプロンプト・パターンに従っています:
    • Persistence reminders(継続性のリマインダー)は、長いワークフロー全体でGPT‑5.2の推論を維持します。
    • Explicit tool‑use expectations(明示的なツール利用の期待値)は、GPT‑4.1に権威あるAPIを呼び出させることで、ハルシネーションを抑制します。
    • Structured planning(構造化された計画)は、GPT‑5.2を活用して、マルチステップのタスクをアウトライン化し、実行します。
    • Agent‑driven rich‑media decisions(エージェント主導のリッチメディア決定)は、GPT‑5.2がツールによって画像、ビデオ、またはフォームを返すべきタイミングを指示できるようにします。
  • 航空会社でのユースケースでは、単一の顧客クエリが運賃規則の確認、ロイヤリティ特典の計算、チケットの変更、およびフライト運用の調整を含む場合があり、状況把握能力とコンテキスト主導のエッジンブル・アーキテクチャの必要性を示しています。

“航空会社では、コンテキストは分刻ぎで変化します。AIは、単に孤立したタスクを実行するだけでなく、顧客が置かれている状況について推論しなければなりません。” – Puneet Mehta, CEO, Netomi.

レッスン 2 – エンタープライズのレイテンシ期待値に応えるため、すべてを並列化する

結論: バースト的な負荷の下でユーザーの信頼を得るために、Netomiはモデル推論とツール呼び出しを並行して実行し、エンドツーエンドのレイテンシを重要な閾値以下に抑えています。

  • 従来のパイプラインは逐次的(分類 → 取得 → 検証 → ツール呼び出し → 生成)です。Netomiの concurrency framework は、これらのステージをオーバーラップさせ、GPT‑4.1の高速なtime‑to‑first‑tokenと安定したストリーミング・ツール呼び出しを活用します。
  • GPT‑5.2は、深い推論が必要なワークフローの部分にのみ呼び出され、レイテンシのボトルネックになるのを防ぎます。
  • DraftKingsのピークイベント時、システムは >40,000件の同時リクエスト/秒 を処理しながら、3秒未満のレスポンス を維持し、アカウント、決済、ナレッジ・ルックアップ、および規制チェックにわたって 98%の意図分類精度 を維持しました。

“AIは、私たちが最も重要な瞬間に顧客をサポートする方法において、中心的かつ不可欠なものです。” – Paul Liberman, Co‑Founder & President of Operations, DraftKings.

レッスン 3 – ガバナンスをランタイムの固有の構成要素にする

結論: 信頼できるエンタープライズAIには、実行レイヤーに組み込まれたガバナンスが必要です。そのため、Netomiのランタイムは、自動的に検証、ポリシーの適用、および不確実性が生じた際の安全なフォールバックを行います。

  • Schema validation(スキーマ検証)は、実行前にすべてのツール呼び出しをに対し、OpenAPI契約に基づきチェックを行います。
  • Policy enforcement(ポリシー適用)は、推論中に、トピック・フィルター、ブランド制限、およびコンプライアンス・ルールをインラインで適用します。
  • PII protection(PII保護)は、前処理およびレスポンス生成中に、機密データを検出し、マスキングします。
  • Deterministic fallback(決定論的フォールバック)は、曖昧な意図図または低信頼度の予測を、事前に承認された安全な挙動へルーティングします。
  • Runtime observability(ランタイム・オブザーバビリティ)は、トークン・トレース、推論ステップ、およびツール・チェーン・ログをリアルタイムでデバッギングおよび監査のために公開します。
  • 年間約200万件のプロバイダー・リクエストを処理する歯科保険の導入事例では、ガバナンス・レイヤーが、高ボリュームのオープン・エンロールメント期間中の規制リスクを防止しました。

“エージェントが不確実性に達したとき、どのように安全に退避するかを正確に知っているように、システムを構築しました。” – Puneet Mehta, CEO, Netomi.

エンタープライズ対応のエージェンティック・システムのためのブループリント

結論: OpenAIのGPT‑4.1とGPT‑5.2を、ガバナンスの効いた並列実行エンジンと組み合わせることで、、Fortune 500企業が求める速度、精度、およびコンプライアンスを満たすプロダクショングレードのエージェンティック・スタックを構築できます。

  • Speed: 3秒未満のレイテンシ。極端な負荷条件下での負荷。
  • Accuracy: 大規模運用における98%の意図分類精度。
  • Governance: 組み込みのスキーマ検証、ポリシー適用、PII保護、PII保護、決定論的フォールバック、および完全なオブザーバビリティ。
  • Scalability: 航空会社、ゲーミング、保険などのドメインにわたって、>40,000件の同時リクエスト/秒を処理。

これらの原則は、プロトタイプ・チャットボットから、信頼できるエンタープライズ・グレードのAIエージェントへ移行しようとするあらゆる組織にとって、、リピート可能なロードマップを提供します。

結果の概要

  • 高トラフィック・イベント中の3秒未満のレスポンスタイム。
  • 大規模運用における98%の意図分類精度。
  • 40,000件を超える同時リクエスト/秒のトラフィック・スパイクをサポート。
  • 決定論的フォールバックとポリシー適用を備えた、ランタイムに組み込まれたガバナンス。
  • United AirlinesやDraftKingsを含む、Fortune 500企業への成功した導入事例。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト