ChatGPT Work 工具与技能参考 – 全面概览
Codex 工具参考是什么以及它为何重要
Codex 工具参考是一个公开托管的清单,列出了 232 个可调用工具接口 和 44 个完整的技能定义,适用于 ChatGPT Work(也称为 Codex)。它为开发者和 AI 代理提供了一个单一可信来源,用于发现、理解并调用驱动 ChatGPT 扩展功能的精确 API——从浏览器自动化到数据分析、GitHub 管理和 Gmail 操作。通过公开 TypeScript 声明、工具描述以及每个技能的完整 SKILL.md 源码,该参考使原本不透明的“插件”生态系统变得透明、可复现且可审计。
主要工具类别的自包含概览
1. 核心可调用接口(223 个工具 + 9 个会话控制)
- 文件与进程操作 –
apply_patch,exec_command,view_image,write_stdin,update_plan。 - 协作原语 –
collaboration.spawn_agent,collaboration.send_message,collaboration.list_agents,collaboration.interrupt_agent,collaboration.wait_agent。 - 技能管理 –
skills__list,skills__read用于发现和加载可重用的指令包。 - 插件处理 –
request_plugin_install在缺少所需能力时建议安装插件。 - MCP 资源 –
list_mcp_resource_templates,list_mcp_resources,read_mcp_resource将服务器端数据暴露给模型。
2. 高层级功能组(技能)
| 类别 | 代表性技能 | 典型用例 |
|---|---|---|
| 文档与视觉内容 | answers-charts, answers-images, documents, imagegen, pdf, Presentations, Spreadsheets, visualize, writing-blocks |
生成图表、编辑 Word/Google 文档、创建位图图像、渲染 PDF、构建幻灯片演示文稿、生成电子表格或渲染交互式可视化内容。 |
| 浏览器与网站 | control-browser, sites:sites-building, sites:sites-hosting, sites:sites-preview-troubleshooting |
使用 Playwright 自动化认证的网页交互,构建并托管静态网站,或排查预览失败问题。 |
| 上下文与交互 | demos:answers-ask-user-input, openai-library:library, personal-context, resolve-recipients |
向用户请求缺失数据,访问 ChatGPT 库,维持对话连续性,或在发送消息前消除收件人身份歧义。 |
| OpenAI、技能与插件 | openai-docs, plugin-creator, plugin-management:plugin-management, skill-creator, skill-installer, template-creator |
获取 OpenAI 产品文档,搭建新插件,管理已安装插件,创建或安装新技能,从现有资产生成可复用模板。 |
| 数据分析 | data-analytics:build-dashboard, data-analytics:build-report, data-analytics:visualize-data, data-analytics:metric-diagnostics, data-analytics:market-sizing |
构建关键绩效指标仪表板,生成高管报告,验证数据质量,诊断指标异常,以及基于透明假设估算市场规模。 |
| 工作宠物与演示 | work-pets:create-pet, work-pets:update-pet, work-pets:pets, demos:onboarding-setup-pet |
创建、预览和管理动画化的 ChatGPT Work “宠物”,以个性化用户体验。 |
| 自动化 | automations.create, automations.update, automations.list, automations.peek |
安排重复提醒、条件监控任务,或为 Gmail、Slack、GitHub 等连接器设置基于 Webhook 的自动化流程。 |
| GitHub | 超过 80 个工具,涵盖仓库的增删改查、问题/拉取请求生命周期、工作流构件和代码搜索(例如 github_create_issue, github_fetch_pr, github_merge_pull_request)。 |
实现从语言模型直接发起的端到端软件开发工作流。 |
| Gmail | 21 个工具用于标签管理、消息读取、草稿撰写、发送、转发和批量操作(例如 gmail_apply_labels_to_emails, gmail_create_draft, gmail_bulk_label_matching_emails)。 |
使 AI 代理能够作为个人助理,组织、撰写并执行邮件操作。 |
该参考如何为 AI 消费而设计
- 技能页面 完全复制
SKILL.md源码,确保模型能无歧义地读取精确的指令集。 - 工具声明 以 TypeScript 签名形式提供,模型可解析以生成类型正确的 JSON 负载。
- 可用性标志(会话配置、权限、已安装插件)均明确记录,使模型能优雅处理缺失能力的情况。
来自 Hacker News 评论的社区洞察
@simonw – “请参见此评论以获取背景信息(以及创建提示):https://news.ycombinator.com/item?id=49504625#49505116” 作者指向原始创建提示,确认该参考是根据底层 Codex 配置程序化生成的。这一来源保障了读者,该清单反映的是实时系统,而非静态快照。
@simonw – “最有趣的技能是
control-browser。它告诉 ChatGPT Work 如何通过其 Node.js REPL 启动一个 Playwright 实例,然后运行nodeRepl.write(await browser.documentation());来获取使用说明。” 该评论突显了一种设计模式:技能将文档生成的重担委托给运行时调用,而非嵌入庞大的 Markdown 文档。这使技能保持简洁,减少重复,并确保文档与底层库保持同步。
@satvikpendem – “我不明白这和 Codex 有什么不同,如果 Codex 能做所有同样的事情。” 区别在于,Codex 指的是底层执行引擎,而 ChatGPT Work(UI 层)强制执行严格的工具调用契约,提供经过筛选的 UI 用于技能选择,并增加安全检查(例如权限控制、令牌预算)。该参考使这些契约变得明确。
@montroser – “我们能否增加一个功能,用于在常规尺寸屏幕上测试网站?除非你在 4K 显示器上,否则左侧边栏需要自行滚动。” 这一请求突显了一个实际限制:许多浏览器自动化技能假设默认视口。为
control-browser扩展set_viewport参数将解决此类特定于 UI 的测试需求。
@enraged_camel – “为什么 AI 生成的网站总是看起来一样?感觉就像 Bootstrap。” 该评论暗示了更广泛的设计偏见:许多视觉生成技能(如
imagegen,visualize)依赖默认样式库。向这些技能引入多样性参数(主题、布局网格、设计系统)可缓解“Bootstrap 效应”。
@felixgallo – “考虑到 Sam Altman 的历史、OpenAI 的安全变更以及 HuggingFace 的失败,使用 ChatGPT Work 是一个严重错误。” 尽管带有政治色彩,但该评论提醒开发者评估平台及其治理的可信度。该参考的开源性质通过允许对工具定义进行独立审计,缓解了部分风险。
@darepublic – “其中一些工作工具可能会拖慢速度并浪费大量令牌。” 确实,调用工具会产生请求/响应负载的令牌开销。参考中明确的
max_output_tokens字段(例如在exec_command中)有助于开发者设置合理限制,避免成本失控。
开发者的实用建议
- 将参考作为契约使用 – 在构建自定义 ChatGPT Work 集成时,直接导入 TypeScript 声明以确保负载兼容性。
- 利用技能复用 – 不要重新实现常见模式(例如“向用户请求缺失上下文”),而是调用现有的
demos:answers-ask-user-input技能以保持提示一致性。 - 审计权限 – 每个工具都列出了所需权限(例如
sandbox_permissions,require_escalated)。在启用技能前,需根据部署的安全策略验证这些权限。 - 以最小摩擦扩展 – 要添加新功能,创建
skill-creator技能,搭建插件目录,并通过plugin-management注册。参考中已包含一个plugin-creator技能,可自动化此流程。 - 监控令牌预算 – 像
exec_command和functions.wait这样的工具暴露了max_output_tokens和yield_time_ms。根据预期命令输出大小调整这些值,以防止不必要的令牌消耗。 - 考虑 UI 限制 – 如果你的工作流依赖视觉布局(例如测试响应式设计),可考虑向
control-browser技能添加视口控制参数,或将其封装在更高层级的技能中,在导航前设置所需尺寸。
结论
Codex 工具参考是一个 全面且机器可读的目录,涵盖了 ChatGPT Work 的所有能力,从底层操作系统命令到高层级业务分析。通过公开 工具签名 和 完整技能源码,它使开发者能够程序化地发现能力、审计安全边界,并构建稳健的 AI 驱动工作流。Hacker News 社区评论揭示了现实世界中的关切——文档设计、UI 体验、令牌效率和平台信任——这些可指导工具集的未来改进。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- Dispatch