OpenAI 與 PNNL 合作加速聯邦許可
OpenAI 與美國能源部的太平洋西北國家實驗室(PNNL)合作,評估程式編碼代理人如何加速關鍵基礎設施的聯邦許可。此合作旨在現代化能源、交通與水系統的審查流程,以減少通常與環境與技術審查相關的多年延遲。
NEPA 起草的潛在效率提升
通用程式編碼代理人可將《國家環境政策法》(NEPA)文件子段的起草時間縮短 1 至 5 小時,最高可達整體起草時間減少 15%。此結果基於 19 位主題專家的評估,涵蓋來自 18 個不同聯邦機構的 NEPA 文件段落的具代表性起草任務。
DraftNEPABench 基準測試
為評估 AI 在政府工作流程中的表現,OpenAI 與 PNNL 開發了 DraftNEPABench,一項旨在評估 AI 模型在起草環境影響說明書等任務上表現的基準。
技術實作
此合作探討使用通用程式編碼代理人(特別是 Codex CLI)從推理模型(如 GPT-5)中提取效能。透過讓模型存取指令列介面,代理人能運用一般問題解決策略,而非依賴手工設計的啟發式方法。這些代理人的任務包括:
- 整合跨越數百頁文件的技術與法規內容。
- 核實多個工程、環境與法規來源的事實。
- 起草符合特定法律與技術標準的結構化報告。
對聯邦基礎設施的影響
加速許可流程被視為提升美國經濟競爭力與發展更安全、更負責任基礎設施的關鍵。目標是將聯邦審查的基礎設施專案的平均批准時間從數月縮短至數週。
除了起草之外,使用程式編碼代理人可將靜態 PDF 轉換為動態產生的網頁報告與互動式視覺化,簡化人工審查者的驗證流程。此轉變使政府工作人員能專注於高層判斷、監督與複雜決策,而 AI 代理人則處理耗時的起草任務。
限制與範圍
此基準評估模型在具明確規範且有可用上下文的起草任務上的能力,而非真實許可決策所需的全部模糊性與裁量權。主要限制包括:
- 參考準確性: 部分發現的錯誤歸因於過時的參考資料或薄弱的評估標準,而非模型失敗。
- 來源材料依賴性: 除非明確指示,模型可能不會標示不完整、前後不一致或過時的來源材料。
- 人工迭代: 由於預期結合專家回饋與迭代精進,實際表現預計會高於這些獨立的基準任務。
未來發展
OpenAI 繼續支援 PNNL 精進 PermitAI 應用的解決方案,旨在協助聯邦機構簡化關鍵基礎設施的許可流程。