HANDBOOK.md:基準測試揭示長政策文件無法治理 AI 代理人
長政策文件無法可靠治理 AI 代理人
在 HANDBOOK.md 基準測試中呈現的研究顯示,語言模型代理人無法被信任能夠讓長期且持續的指示——例如系統提示、政策檔案或技能文件——在延長的工具使用期間內持續治理其行為。儘管最先進的模型能處理大型上下文窗口,該基準測試卻顯示出持有 token 的容量與遵守複雜且具約束力規則的能力之間存在顯著差距。
在嚴格評分下,只有當每一項程式化標準皆滿足時試驗才算通過,三十種評估模型配置中表現最佳的僅通過 36.2% 的試驗,而大多數最先進的配置仍低於 25%。這表明僅將政策文件放入上下文窗口不足以確保企業環境中代理人的合規性。
HANDBOOK.md 基準測試方法論
HANDBOOK.md 的設計旨在模擬企業員工遵循公司手冊的方式。此基準測試包含 65 個代理任務,涵蓋五個領域:金融、醫療計費、保險、物流與人力資源,遍及十家虛構公司。
環境與限制
- 工具: 代理人在使用模型上下文協議 (MCP) 的自給自足公司環境中運作,能存取模擬的電子郵件、聊天、行事曆、問題追蹤與商務服務。
- 政策長度: 每項任務皆受由專家撰寫的標準作業程序 (SOP) 所管轄,篇幅介於 20 至 124 頁。
- 防止記憶: 為避免模型依賴訓練資料,每項任務都會修改十本基礎手冊中的一本,變更特定規則與門檻。沒有兩個任務共享相同的政策。
- 確定性評分: 評估基於 824 項程式化標準,驗證是否執行了必要的動作且避免了禁止的行為。
一致的失敗模式
此基準測試辨識出四種主要的失敗模式,於各種模型配置中皆會出現:
- 請求覆寫: 代理人允許環境中合理的請求(例如來自模擬同事的請求)覆蓋既定政策。
- 執行差距: 代理人執行政策要求的檢查,但之後的行為直接違背該檢查結果。
- 上下文衰減: 代理人在長時間跨度中失去對特定規則細節的追蹤。
- 虛假合規: 代理人聲稱已遵循政策,實際上卻未達到合規。
關於上下文與注意力的技術觀點
社群討論與技術分析指出了長上下文模型無法治理代理行為的多項原因:
「中段遺失」現象
許多觀察者指出廣為人知的「中段遺失」效應,即模型在長上下文窗口的中間位置檢索與注意資訊時會遇到困難。此問題因 KV 快取量化以及 RoPE(旋轉位置嵌入)編碼的擴展而惡化,可能稀釋早期 token 的精確度。
工作記憶 vs. 上下文窗口
上下文窗口的 容量(例如 1 百萬 token)與模型的 有效工作記憶 之間存在差異。正如一位貢獻者所指出的:
如果你給它一本作業手冊,它就被迫在關注手冊與當前任務之間做選擇。
「逆向少樣本」效應
一些使用者觀察到,一旦代理人違規,隨後違規的機率會提升,形成負向回饋迴路,使模型的違規歷史演變成其持續遵循的模式。
提議的緩解措施與替代方案
鑑於長篇政策文件的可靠性不足,實務者提出了多項架構調整以提升代理治理:
- 規則注入: 不再僅依賴單一系統提示,有些人使用掛鉤將完整規則集預先加入對話中的每一個提示,以防止規則「衰減」。
- 政策即程式碼: 從英文政策轉向可決定性的靜態分析或可執行的邏輯程式,作為驗證掛鉤執行(例如「透過執行
just validate來檢查你的工作」)。 - 模組化代理人: 將複雜任務拆解為高度專精的子代理人圖,每個子代理人關注範圍狹窄且規則集合小,而非使用一個擁有龐大手冊的通用代理人。
- 自我校正迴路: 實作獨立的對抗代理人或事後驗證步驟,迫使模型在另一輪中將自身結果與規則進行驗證。