ChatGPT Work用ツールおよびスキルリファレンス – 総合的な概要

Codexツールリファレンスとは何か、なぜ重要なのか

Codexツールリファレンスは、232の呼び出し可能なツールインターフェース44の完全なスキル定義をリストアップした公開ホスト型インベントリです。ChatGPT Work(別名Codex)の開発者やAIエージェントが、拡張機能を実現するための正確なAPIを発見・理解・呼び出すための単一の真実のソースとして機能しています。ブラウザ自動化からデータ分析、GitHub管理、Gmail操作まで、さまざまな機能をカバーしています。TypeScriptの宣言、ツールの説明、各スキルの完全な SKILL.md ソースを公開することで、もともと不透明だった「プラグイン」エコシステムを透明化、再現可能化、監査可能化しています。


主なツールカテゴリの自己完結型概要

1. コアの呼び出し可能なインターフェース(223ツール + 9つのセッション制御)

  • ファイルおよびプロセス操作apply_patch, exec_command, view_image, write_stdin, update_plan
  • コラボレーションプリミティブcollaboration.spawn_agent, collaboration.send_message, collaboration.list_agents, collaboration.interrupt_agent, collaboration.wait_agent
  • スキル管理skills__list, skills__read は再利用可能な指示パッケージを発見・ロードするためのものです。
  • プラグイン処理request_plugin_install は、必要な機能が不足している場合にプラグインのインストールを提案します。
  • MCPリソースlist_mcp_resource_templates, list_mcp_resources, read_mcp_resource は、サーバーサイドデータをモデルに公開します。

2. 高レベルの機能グループ(スキル)

カテゴリ 代表的なスキル 一般的な使用例
ドキュメントおよびビジュアル answers-charts, answers-images, documents, imagegen, pdf, Presentations, Spreadsheets, visualize, writing-blocks チャートの生成、Word/Google Docsの編集、ラスタ画像の作成、PDFのレンダリング、スライドデッキの構築、スプレッドシートの作成、インタラクティブなビジュアライゼーションのレンダリング。
ブラウザおよびサイト control-browser, sites:sites-building, sites:sites-hosting, sites:sites-preview-troubleshooting Playwrightによる認証済みWeb操作の自動化、静的サイトの構築およびホスティング、プレビュー失敗のトラブルシューティング。
コンテキストおよびインタラクション demos:answers-ask-user-input, openai-library:library, personal-context, resolve-recipients ユーザーに不足しているデータを要求、ChatGPTライブラリにアクセス、会話の継続性を維持、メッセージ送信前の受信者識別を明確化。
OpenAI、スキルおよびプラグイン openai-docs, plugin-creator, plugin-management:plugin-management, skill-creator, skill-installer, template-creator OpenAI製品のドキュメントを取得、新しいプラグインのスケルトン作成、インストール済みプラグインの管理、新しいスキルの作成またはインストール、既存のアーティファクトから再利用可能なテンプレートを生成。
データ分析 data-analytics:build-dashboard, data-analytics:build-report, data-analytics:visualize-data, data-analytics:metric-diagnostics, data-analytics:market-sizing KPIダッシュボードの構築、経営報告書の作成、データ品質の検証、メトリクスの異常診断、透明な仮定に基づく市場規模の推定。
ワークペットおよびデモ work-pets:create-pet, work-pets:update-pet, work-pets:pets, demos:onboarding-setup-pet 動的なChatGPT Work「ペット」を作成・プレビュー・管理し、ユーザー体験をパーソナライズ。
自動化 automations.create, automations.update, automations.list, automations.peek 定期的なリマインダーのスケジューリング、条件監視タスク、Gmail、Slack、GitHub、その他のコネクタ向けのWebhook駆動型自動化。
GitHub 80以上のツールでリポジトリのCRUD、イシュー/PRのライフサイクル、ワークフローのアーティファクト、コード検索(例:github_create_issue, github_fetch_pr, github_merge_pull_request)をカバー。 言語モデルから直接、エンドツーエンドのソフトウェア開発ワークフローを可能にする。
Gmail ラベル管理、メッセージの読み取り、下書き作成、送信、転送、一括操作のための21のツール(例:gmail_apply_labels_to_emails, gmail_create_draft, gmail_bulk_label_matching_emails)。 AIエージェントが個人アシスタントとしてメールを整理・作成・処理できるようにする。

AIによる利用を想定したリファレンスの構造

  • スキルページSKILL.md ソースをそのまま再現しており、モデルが曖昧さなく正確な指示セットを読み取れるようにしています。
  • ツール宣言はTypeScriptのシグネチャとして提供され、モデルが正しい型のJSONペイロードを生成できるようにしています。
  • 利用可能フラグ(セッション設定、権限、インストール済みプラグイン)は明示的に文書化されており、モデルが不足した機能に対してもスムーズに対処できるようにしています。

Hacker Newsのコメントから得られるコミュニティの知見

@simonw「背景(および作成プロンプト)についてはこのコメントを参照してください: https://news.ycombinator.com/item?id=49504625#49505116」 著者は元の作成プロンプトを指摘しており、リファレンスが下位のCodex構成からプログラム的に生成されたことを確認しています。この出自により、インベントリが静的スナップショットではなく、ライブシステムを反映していることが保証されます。

@simonw「最も興味深いスキルは control-browser です。これはChatGPT Workに、Node.js REPLを介してPlaywrightインスタンスを起動する方法を伝え、その後 nodeRepl.write(await browser.documentation()); を実行して使用方法の説明を取得するように指示しています。」 このコメントは、ドキュメントの重い処理を埋め込みではなく、実行時呼び出しに委ねるという設計パターンを強調しています。これにより、スキルは簡潔に保たれ、重複が減り、ドキュメントが下位ライブラリと同期したままになります。

@satvikpendem「Codexがすべて同じことができるのなら、これがCodexとどう違うのかわかりません。」 違いは、Codex が下位の実行エンジンを指すのに対し、ChatGPT Work(UIレイヤー)は厳格なツールコール契約を強制し、選択可能なUIを提供し、セキュリティチェック(例:権限ゲート、トークン予算)を追加している点です。リファレンスはこれらの契約を明確にしています。

@montroser「通常サイズの画面でウェブサイトをテストする方法についてのツールがほしいです。左側のサイドバーは4Kモニタでない限り、独自にスクロールする必要があります。」 この要望は、多くのブラウザ自動化スキルがデフォルトのビューポートを前提としているという実用的な制限を浮き彫りにしています。control-browserset_viewport パラメータを追加することで、このようなUI固有のテスト要件に対応できます。

@enraged_camel「なぜAI生成のウェブサイトはいつも同じように見えるのでしょうか?Bootstrapのようですね。」 このコメントは、広範なデザインバイアスを示唆しています。多くのビジュアル生成スキル(例:imagegen, visualize)はデフォルトのスタイルライブラリに依存しています。これらのスキルに多様性パラメータ(テーマ、レイアウトグリッド、デザインシステム)を導入することで、「Bootstrap効果」を軽減できます。

@felixgallo「サム・オルトマンの歴史、OpenAIの安全対策の変更、HuggingFaceの失敗を考慮すると、ChatGPT Workを使うのは重大な誤りです。」 政治的なコメントではありますが、開発者はプラットフォームとそのガバナンスの信頼性を評価する必要があることを思い出させます。リファレンスのオープンソース性により、ツール定義の独立した監査が可能になり、リスクの一部が軽減されます。

@darepublic「これらのワークツールの一部は、処理を遅くし、豊富なトークンを無駄にします。」 確かに、ツールの呼び出しにはリクエスト/レスポンスペイロードのトークンオーバーヘッドが発生します。リファレンスの明示的な max_output_tokens フィールド(例:exec_command など)により、開発者は現実的な制限を設定し、無駄なコストを回避できます。


開発者向けの実践的な教訓

  1. リファレンスを契約として利用する – カスタムChatGPT Work統合を構築する際は、TypeScript宣言を直接インポートして、ペイロードの互換性を保証する。
  2. スキルの再利用を活用する – 「不足しているコンテキストをユーザーに尋ねる」などの一般的なパターンを再実装するのではなく、既存の demos:answers-ask-user-input スキルを呼び出すことで、プロンプトの一貫性を保つ。
  3. 権限を監査する – 各ツールには必要な権限(例:sandbox_permissions, require_escalated)がリストアップされている。スキルを有効化する前に、その権限がデプロイメントのセキュリティポリシーと一致するかを検証する。
  4. 最小限の摩擦で拡張する – 新しい機能を追加するには、skill-creator スキルを作成し、プラグインディレクトリをスケルトン化し、plugin-management で登録する。リファレンスには既にこのワークフローを自動化する plugin-creator スキルが含まれている。
  5. トークン予算を監視するexec_commandfunctions.wait などのツールは max_output_tokensyield_time_ms を公開している。コマンド出力の予想サイズに応じてこれらの値を調整し、不要なトークン消費を防ぐ。
  6. UI制約を計画する – ビジュアルレイアウトに依存するワークフロー(例:レスポンシブデザインのテスト)がある場合は、control-browser スキルにビューポート制御パラメータを追加する、またはナビゲーション前に希望のサイズを設定する高レベルのスキルでラップすることを検討する。

結論

Codexツールリファレンスは、低レベルのOSコマンドから高レベルのビジネス分析まで、ChatGPT Workが実行可能なすべてのことを網羅した包括的で機械可読性の高いカタログです。ツールシグネチャ完全なスキルソースの両方を公開することで、開発者は機能をプログラム的に発見し、セキュリティ境界を監査し、堅牢なAI駆動ワークフローを構築できるようになります。Hacker Newsのコミュニティコメントから浮き彫りになった実世界の懸念——ドキュメント設計、UIの使いやすさ、トークン効率、プラットフォームの信頼性——は、今後のツールセットの改善を導く手がかりとなります。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch