OpenAI 內部資料代理的內幕
OpenAI 開發了一個專屬的僅限內部使用的 AI 資料代理,旨在簡化公司龐大內部資料平台上的資料探索與分析。透過結合自然語言介面與複雜的多層次上下文系統,該代理讓工程、資料科學、財務與研究部門的員工能在數分鐘內,從複雜問題轉化為可行的洞見,而非需要數天時間。
端到端自主資料分析
OpenAI 資料代理負責整個分析工作流程——從最初的資料探索與 SQL 產生,到筆記本與報告的發布。與遵循固定腳本的傳統工具不同,該代理採用 閉環、自我學習的流程,即時評估自身的進度。若中間結果不正確(例如查詢因連接錯誤返回零列),代理會調查失敗原因、調整方法,並在保留完整上下文的情況下重新執行分析。
六層上下文架構
為確保準確性並防止常見失誤(如錯估使用者數量或誤解內部術語),該代理以六個不同的上下文層為基礎:
1. 表格使用
代理利用結構描述的中繼資料(欄位名稱與資料類型)以及表格血統,來了解資料集之間的關係。它亦會吸收歷史查詢,以推斷表格通常的連接與查詢方式。
2. 人類註釋
領域專家提供精心編寫的表格與欄位說明,以捕捉商業意涵、目的與僅憑結構無法推斷的注意事項。
3. Codex 強化
透過推導表格的程式碼層級定義,代理了解資料如何透過管線邏輯建構。這使它能區分外觀相似的表格(例如判斷某表格是否僅包含第一方 ChatGPT 流量),並了解資料的新鮮度與粒度。
4. 組織知識
代理與 Slack、Google Docs 與 Notion 整合,取得關於產品發布、可靠性事件、內部代號與標準指標定義的上下文。此資訊透過具嚴格存取控制的檢索服務進行管理。
5. 記憶
代理實作記憶系統,以保留不易察覺的修正、過濾與限制。當使用者更正代理或發現細微差異時,代理會儲存此學習,確保未來的查詢能從更精確的基線開始。
6. 執行時上下文
當先前的上下文過時或缺失時,代理會發出即時查詢至資料倉儲,並與其他資料平台系統(如 Airflow 與 Spark)溝通,以即時驗證結構並了解資料。
技術實作與擴展
OpenAI 透過每日離線管線管理超過 70,000 個資料集與 600 PB 資料的規模。此管線將使用情況、註釋與 Codex 強化彙總為正規化的表示,並透過 OpenAI Embeddings API 轉換為向量嵌入。查詢時,代理使用 Retrieval-Augmented Generation (RAG) 只提取最相關的上下文,確保低執行時延遲。
評估與品質控制
為防止品質漂移,OpenAI 使用基於精選問答對的系統化評估框架。每對包含自然語言問題與「金標」SQL 查詢。代理產生的 SQL 與結果資料會使用 Evals 評分器與金標集合比較,該評分器會考慮 SQL 的語法變化,只要仍產生正確結果即視為合格。
安全性與權限
代理作為直通介面層運作。它繼承並執行現有的 OpenAI 安全與存取控制模型,意味著使用者只能查詢已獲得明確授權的表格。
主要工程教訓
OpenAI 在開發內部代理的過程中,歸納出三項主要教訓:
- 工具整合: 提供過多重疊的工具會讓代理感到困惑;限制並整合工具呼叫提升了可靠性。
- 高層次指引: 嚴格、規範的提示會降低結果品質。改為高層次目標並依賴 GPT-5 的推理能力,可產生更穩健的結果。
- 程式碼為中心的意義: 雖然結構描述形狀,但資料的真正意義存在於管線程式碼中。使用 Codex 爬梳程式碼庫,提供了最精確的表格內容與使用時機的理解。
工具堆疊
該代理使用與外部開發者相同的工具構建,包括:
- GPT-5 旗艦模型 用於核心推理。
- Codex 用於程式碼層級的表格強化。
- Evals API 用於系統化回歸測試。
- Embeddings API 用於上下文檢索。