OpenAI Responses API 電腦環境更新

OpenAI 已將電腦環境整合至 Responses API,使 AI 代理人能超越文字生成,執行複雜工作流程。透過為模型提供 shell 工具與託管的容器工作區,平台現在可以在隔離環境中執行服務、向 API 請求資料,並產生如試算表或報告等成果。

Shell 工具與執行迴圈

Shell 工具讓模型能透過命令列介面與電腦互動,使用熟悉的 Unix 工具,如 grepcurlawk。與僅支援 Python 的現有程式碼直譯器不同,Shell 工具可執行 Go、Java 與 NodeJS 伺服器,顯著擴大可能的代理任務範圍。

透過 Responses API 的協調

Responses API 充當模型與託管工具之間的協調者。要使 Shell 執行運作,提示必須指定使用 Shell 工具,且模型必須接受過 Shell 指令的訓練(特別是 GPT-5.2 及之後的版本)。

執行迴圈遵循以下流程:

  1. 模型提出一個或多個 Shell 指令。
  2. Responses API 將這些指令轉發給容器執行環境。
  3. API 以近即時的方式將輸出串流回模型。
  4. 模型檢查結果,然後發出後續指令或給出最終答案。

為維持效率,Responses API 支援在不同容器會話中同時執行多個指令,並對每個指令的輸出設置上限,以防大量終端機日誌佔用上下文視窗。

上下文管理與壓縮

為防止長時間運行的代理迴圈耗盡上下文視窗,OpenAI 引入了原生壓縮功能。此系統讓模型分析先前對話狀態,並產生加密且具代幣效率的關鍵細節表示。

壓縮實作

壓縮可作為內建的伺服器端功能或透過獨立的 /compact 端點使用。伺服器端壓縮使用可設定的閾值自動處理時機,允許接近上下文限制的請求被處理並壓縮,而非被拒絕。此機制是透過 Codex 的使用而開發與精進的,Codex 利用壓縮在長時間的程式編寫任務中維持迭代工具執行。

容器上下文與資源管理

託管的容器作為模型的工作上下文,提供受控的環境以進行資料操作與外部互動。

檔案系統與資料庫

OpenAI 提供容器與檔案 API,協助模型映射可用資料,鼓勵將資源預置於容器檔案系統,而非塞入提示中。對於結構化資料,建議使用 SQLite;模型可取得資料表描述,僅查詢必要的列,這比在提示中掃描整個資料集更具可擴展性與成本效益。

安全網路存取

為降低不受限制的網際網路存取所帶來的風險,託管容器使用 sidecar 出站代理。此集中式政策層執行白名單與存取控制。認證方面,於出站點使用域範圍的機密注入,意味著原始機密值保持在模型可見上下文之外,僅在核准的目的地使用。

可重複使用的代理技能

代理技能讓開發者將重複的多步驟模式封裝成可重複使用的組件,避免模型在每次執行時重新發掘工作流程。技能由一個資料夾包構成,內含 SKILL.md 檔案(中繼資料與說明)以及 API 規格等支援資源。

技能整合工作流程

當使用技能時,Responses API 會遵循以下確定性流程:

  1. 取得技能中繼資料(名稱與描述)。
  2. 取得技能包,複製至容器,並解壓縮。
  3. 使用技能中繼資料與容器路徑更新模型上下文。

模型接著使用 Shell 指令發現這些檔案,並依照說明執行腳本。

Sources