OpenAI内部数据代理内部揭秘
OpenAI 开发了一个专属的内部 AI 数据代理,旨在简化公司庞大内部数据平台上的数据探索和分析。通过将自然语言界面与复杂的多层上下文系统相结合,该代理使工程、数据科学、金融和研究等部门的员工能够在几分钟内而非几天内,从复杂的问题转化为可操作的洞见。
端到端自主数据分析
OpenAI 数据代理处理完整的分析工作流——从最初的数据发现和 SQL 生成到笔记本和报告的发布。不同于遵循固定脚本的传统工具,该代理采用 闭环、自学习过程,实时评估自身进度。如果中间结果不正确(例如查询因连接错误返回零行),代理会调查失败原因,调整方法,并在保留完整上下文的情况下重新进行分析。
六层上下文架构
为确保准确性并防止常见错误(如误估用户数量或误解内部术语),该代理基于六个不同的上下文层。
1. 表使用
代理利用模式元数据(列名和数据类型)以及表血缘来理解数据集之间的关系。它还会摄取历史查询,以推断表通常是如何被连接和查询的。
2. 人工注释
领域专家提供表和列的精心描述,以捕获业务含义、意图以及仅凭模式无法推断的注意事项。
3. Codex 丰富
通过获取表的代码级定义,代理了解数据通过管道逻辑是如何构建的。这使其能够区分外观相似的表(例如,判断表是否仅包含第一方 ChatGPT 流量),并理解数据的新鲜度和粒度。
4. 机构知识
代理与 Slack、Google Docs 和 Notion 集成,以检索产品发布、可靠性事件、内部代号以及规范指标定义等上下文信息。这些信息通过具备严格访问控制的检索服务进行管理。
5. 记忆
代理实现了记忆系统,以保留不明显的纠正、过滤器和约束。当用户纠正代理或发现细微差别时,代理会保存这些学习,以确保后续查询从更准确的基线开始。
6. 运行时上下文
当先前的上下文陈旧或缺失时,代理会向数据仓库发起实时查询,并与其他数据平台系统(如 Airflow 和 Spark)通信,以验证模式并实时了解数据。
技术实现与扩展
OpenAI 使用每日离线管道管理超过 70,000 个数据集和 600 PB 数据的规模。该管道将使用情况、注释和 Codex 丰富聚合为规范化表示,然后通过 OpenAI Embeddings API 将其转换为嵌入。在查询时,代理使用 检索增强生成 (RAG) 仅提取最相关的上下文,从而确保低运行时延迟。
评估与质量控制
为防止质量漂移,OpenAI 使用基于精心策划的问答对的系统评估框架。每对包括自然语言问题和“黄金”SQL 查询。代理生成的 SQL 及其结果数据会使用 Evals 评分器与黄金集合进行比较,评分器能够考虑仍能产生正确结果的 SQL 语法变体。
安全与权限
代理作为直通接口层运行。它继承并执行现有的 OpenAI 安全和访问控制模型,这意味着用户只能查询其已拥有明确权限的表。
关键工程经验
- 工具整合: 提供过多重叠的工具会使代理困惑;限制并整合工具调用提升了可靠性。
- 高层指导: 刚性、规定性的提示会降低结果。转向高层目标并依赖 GPT-5 的推理能力可产生更稳健的结果。
- 代码中心意义: 虽然模式描述形状,但数据的真实含义存在于管道代码中。使用 Codex 爬取代码库提供了对表内容及使用时机的最准确理解。
工具栈
- GPT-5旗舰模型 用于核心推理。
- Codex 用于代码级表丰富。
- Evals API 用于系统回归测试。
- Embeddings API 用于上下文检索。