Anthropic 展示問題分解能提升模型生成推理的忠實度
TL;DR
Anthropic 展示了透過提示大型語言模型 (LLM) 將問題分解為更簡單的子問題,所產生的推理比傳統的思維鏈 (CoT) 提示更能忠實地反映模型的內部過程,同時保留了 CoT 的大部分性能增益。
為什麼問題分解很重要
分解要求模型在不同的上下文中回答較簡單的子問題,這極大地增加了模型陳述的推理與其實際計算之間的對齊程度。隨著 LLM 處理日益複雜的任務,這種更高的忠實度對於驗證正確性和安全性至關重要。
核心技術方法
- Decomposition Prompting: 與其要求模型產生單一、不間斷的推理鏈,提示詞會指示模型將原始查詢分解為一系列子問題。
- Separate Contexts: 每個子問題都在其各自的上下文中回答,防止模型將步驟混淆或跳過推理。
- Aggregation: 最終答案是由子答案組合而成的,在保持邏輯流的同時,使每個推理步驟都保持明確。
相對於思維鏈 (Chain‑of‑Thought) 的性能
- 基於分解的方法在標準問答基準測試中取得了強大的結果,有時接近 CoT 的準確度。
- 至關重要的是,在最近提出的幾項忠實度指標上,分解法優於 CoT,這表明生成的推理是模型內部決策過程更真實的追蹤。
評估的忠實度指標
Anthropic 評估了這些方法,使用了多種旨在評估模型書寫的推理與其實際計算匹配程度的指標。雖然文章中沒有列出具體數字,但報告指出在使用分解法時,這些指標均有持續的改進。
對模型安全與驗證的影響
- Enhanced Auditing: 更忠實的推理追蹤使外部審計員能夠逐步檢查並驗證模型行為。
- Safety Guarantees: 當推理與內部過程對齊時,就更容易檢測出幻覺、邏輯錯誤或不安全的決策路徑。
- Future Research: 研究結果顯示了一條通往可靠推理的路徑,這種推理可以用來證明模型輸出的可靠性,這是高風險應用程式的關鍵要求。
限制與開放性問題
- 由於多次上下文切換,該方法可能會產生額外的計算開銷。
- 雖然忠實度有所提升,但文章也承認性能並不總是能與最佳的 CoT 結果相匹配,這表明存在一個需要進一步研究的權衡。
相關 Anthropic 研究
- Patterns and problems in emerging multi‑agent systems: 探討前沿模型中的系統性風險。
- Reviewing the evidence on worker retraining programs: 與外部研究人員共同撰寫的政策導向評論。
- Learning more about Claude's mathematical capabilities: 強調了 Claude 在貢獻數學研究方面的進步,例如改進與黎曼猜想相關的界限。
此摘要基於 Anthropic 於 2023 年 7 月 18 日發布的研究公告。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch