OpenAI社内データエージェントの内部

OpenAIは、社内専用のカスタムAIデータエージェントを開発し、同社の膨大な内部データプラットフォーム全体でデータ探索と分析を効率化しています。自然言語インターフェースと高度な多層コンテキストシステムを組み合わせることで、エンジニアリング、データサイエンス、財務、リサーチの各部門の従業員が、複雑な質問から実行可能なインサイトへと、数日ではなく数分で移行できるようになっています。

エンドツーエンドの自律データ分析

OpenAIのデータエージェントは、初期のデータ探索とSQL生成からノートブックやレポートの公開まで、分析ワークフロー全体を処理します。固定スクリプトに従う従来のツールとは異なり、エージェントは閉ループ型の自己学習プロセスを採用し、リアルタイムで自身の進捗を評価します。たとえば、結合エラーによりクエリがゼロ行を返した場合など、中間結果が誤っていると判断すると、エージェントは失敗原因を調査し、アプローチを修正して再試行し、完全なコンテキストを保持したまま分析を続行します。

6層のコンテキストアーキテクチャ

正確性を確保し、ユーザー数の過大評価や社内用語の誤解といった一般的な失敗を防ぐため、エージェントは以下の6つの異なるコンテキスト層に基づいて動作します。

1. テーブル使用状況

エージェントはスキーマメタデータ(列名とデータ型)とテーブル系統情報を利用して、データセット間の関係を把握します。また、過去のクエリ履歴を取り込み、テーブルがどのように結合・クエリされることが多いかを推測します。

2. 人間による注釈

ドメインエキスパートがテーブルや列の説明をキュレーションし、スキーマだけからは読み取れないビジネス上の意味、意図、注意点を捕捉します。

3. Codexによる強化

テーブルのコードレベル定義を抽出することで、エージェントはパイプラインロジックを通じてデータがどのように構築されているかを理解します。これにより、見た目が似通ったテーブル(例:ChatGPTの一次トラフィックのみを含むテーブルかどうか)を区別し、データの鮮度や粒度を把握できます。

4. 組織的知識

エージェントはSlack、Google Docs、Notionと連携し、製品リリース、信頼性インシデント、社内コードネーム、標準指標定義などのコンテキストを取得します。この情報は厳格なアクセス制御を備えた検索サービスを通じて管理されます。

5. メモリ

エージェントは、明示的でない修正やフィルタ、制約を保持するメモリシステムを実装しています。ユーザーがエージェントを訂正したり、ニュアンスが判明したりした場合、その学習内容を保存し、将来のクエリがより正確なベースラインから開始できるようにします。

6. ランタイムコンテキスト

過去のコンテキストが古い、または欠如している場合、エージェントはデータウェアハウスに対してライブクエリを発行し、AirflowやSparkといった他のデータプラットフォームシステムと通信してスキーマを検証し、リアルタイムでデータを把握します。

技術実装とスケーリング

OpenAIは、70,000以上のデータセットと600ペタバイトに及ぶデータを、日次のオフラインパイプラインで管理しています。このパイプラインは使用状況、注釈、Codex強化情報を集約し、正規化された表現に変換したうえで、OpenAI Embeddings APIを用いて埋め込みベクトルに変換します。クエリ時にはエージェントが**取得強化生成(RAG)**を利用して最も関連性の高いコンテキストのみを引き出し、低レイテンシで応答します。

評価と品質管理

品質のドリフトを防ぐため、OpenAIはキュレーションされた質問‑回答ペアに基づく体系的評価フレームワークを使用しています。各ペアは自然言語の質問と「ゴールデン」SQLクエリで構成され、エージェントが生成したSQLと取得結果はEvalsグレーダーで比較されます。Evalsは、結果が正しい限りSQLの構文バリエーションを許容します。

セキュリティと権限

エージェントはパススルーインターフェース層として機能し、既存のOpenAIセキュリティおよびアクセス制御モデルを継承・適用します。したがって、ユーザーは自分が既に明示的に許可されたテーブルに対してのみクエリを実行できます。

主なエンジニアリング教訓

OpenAIは内部エージェントの開発過程で、以下の3つの主要な教訓を得ました。

  • ツールの統合: 重複するツールが多すぎるとエージェントが混乱します。ツール呼び出しを制限・統合することで信頼性が向上しました。
  • 高レベルの指示: 厳格で指示的なプロンプトは結果を劣化させました。高レベルのゴールにシフトし、GPT‑5の推論能力に委ねることで、より堅牢なアウトプットが得られました。
  • コード中心の意味付け: スキーマは形状を示すだけで、データの真の意味はパイプラインコードにあります。Codexでコードベースをクロールすることで、テーブルに何が含まれ、いつ使用すべきかを最も正確に把握できました。

ツールスタック

エージェントは外部開発者が利用できる同様のツール群で構築されています。

  • GPT‑5 フラッグシップモデル – コア推論エンジン。
  • Codex – コードレベルのテーブル強化。
  • Evals API – 系統的回帰テスト。
  • Embeddings API – コンテキスト検索。

Sources