OpenAI 深度研究
總覽
OpenAI 已推出 深度研究,這是一項位於 ChatGPT 內的新代理能力,旨在自動化複雜的多步驟網路研究。透過綜合數百個線上來源,該工具能在數十分鐘內完成研究任務,而這通常需要人類數小時,並產出附有完整文件和引用的綜合報告。
技術基礎與方法論
深度研究由即將推出的 OpenAI o3 模型 版本提供動力,該版本專門針對網路瀏覽與資料分析進行了優化。
訓練與推理
深度研究是透過在具挑戰性的瀏覽與推理任務上進行端到端強化學習而開發的。它使用與 OpenAI o1 相同的強化學習方法,使模型能夠:
- 規劃並執行多步驟軌跡以定位數據。
- 根據遇到的資訊即時回溯並調整搜尋策略。
- 瀏覽使用者上傳的檔案並利用 Python 工具繪製與迭代圖表。
- 引用來源中的特定句子或段落以確保可驗證性。
效能基準
驅動深度研究的模型在多項公開評估中達到了新的最先進(SOTA)成績:
- 人類最後的考試: 該模型在此專家級別測試(涵蓋 100+ 個學科)上達到 26.6% 的準確率,顯著優於 GPT-4o(3.3%)和 OpenAI o1(9.1%)。
- GAIA: 深度研究在 GAIA 基準上達到了新的 SOTA,該基準測試推理、多模態流暢度和工具使用。其平均得分為 67.36%(pass@1)以及 72.57%(cons@64)。
主要功能與使用案例
深度研究專為金融、科學、政策和工程等領域的密集知識工作以及高風險的消費者研究(例如購買汽車或家電)而設計。
與 GPT-4o 的功能差異
雖然 GPT-4o 已針對即時多模態對話進行優化,但深度研究是為了多面向、特定領域的查詢而構建,在這些情境下深度、細節和驗證至關重要。它將快速摘要轉變為有文件記錄的工作成果。
工作流程與使用者體驗
使用者在 ChatGPT 訊息撰寫器中選取 "deep research" 並提供查詢。此過程通常需要 5 到 30 分鐘。在此期間,側邊欄會提供已執行步驟和使用來源的即時摘要。最終輸出為聊天內的詳細報告。
存取與迭代更新
OpenAI 正以迭代方式部署深度研究,以管理高運算強度。
可用性與限制
截至 2025 年 4 月 24 日,使用限制已更新以包含由 o4-mini 提供動力的輕量版本,以提高效率:
- Pro 使用者: 每月 250 次查詢。
- Plus、Team、Enterprise 和 Edu 使用者: 每月 25 次查詢。
- 免費使用者: 每月 5 次查詢。
功能演變
- 2026 年 2 月 10 日: 新增連線至 MCP 或應用程式、限制搜尋至可信網站的能力、即時進度追蹤,以及透過後續提示中斷並精煉研究的能力。
- 2025 年 7 月 17 日: 透過 ChatGPT 代理引入 "agent mode",提供視覺化瀏覽器以進行更廣泛且更深入的研究。
限制與安全
儘管具有該能力,深度研究仍有已知限制:
- 準確性: 它仍可能產生幻覺事實或做出錯誤推論,儘管比先前的 ChatGPT 模型發生率較低。
- 校準: 模型偶爾難以區分謠言與權威資訊,且可能無法準確傳達不確定性。
- 格式: 報告和引用中可能會出現小幅格式錯誤。
關於安全,OpenAI 的備援框架將驅動深度研究的早期 o3 版本識別為 Medium 風險。實驗室已實施專門針對網路瀏覽風險的緩解措施,並繼續監控有限發布。
未來路線圖
OpenAI 計畫擴展深度研究對專門數據來源的存取,包括訂閱制或內部資源。長遠願景是將深度研究(非同步調查)與 Operator(真實世界行動)整合,以使 ChatGPT 能夠執行日益複雜的端到端任務。
Sources
- OriginalIntroducing deep research