Anthropic 展示問題分解能提升模型生成推理的忠實度

TL;DR

Anthropic 展示了透過提示大型語言模型 (LLM) 將問題分解為更簡單的子問題,所產生的推理比傳統的思維鏈 (CoT) 提示更能忠實地反映模型的內部過程,同時保留了 CoT 的大部分性能增益。

為什麼問題分解很重要

分解要求模型在不同的上下文中回答較簡單的子問題,這極大地增加了模型陳述的推理與其實際計算之間的對齊程度。隨著 LLM 處理日益複雜的任務,這種更高的忠實度對於驗證正確性和安全性至關重要。

核心技術方法

  • Decomposition Prompting: 與其要求模型產生單一、不間斷的推理鏈,提示詞會指示模型將原始查詢分解為一系列子問題。
  • Separate Contexts: 每個子問題都在其各自的上下文中回答,防止模型將步驟混淆或跳過推理。
  • Aggregation: 最終答案是由子答案組合而成的,在保持邏輯流的同時,使每個推理步驟都保持明確。

相對於思維鏈 (Chain‑of‑Thought) 的性能

  • 基於分解的方法在標準問答基準測試中取得了強大的結果,有時接近 CoT 的準確度。
  • 至關重要的是,在最近提出的幾項忠實度指標上,分解法優於 CoT,這表明生成的推理是模型內部決策過程更真實的追蹤。

評估的忠實度指標

Anthropic 評估了這些方法,使用了多種旨在評估模型書寫的推理與其實際計算匹配程度的指標。雖然文章中沒有列出具體數字,但報告指出在使用分解法時,這些指標均有持續的改進。

對模型安全與驗證的影響

  • Enhanced Auditing: 更忠實的推理追蹤使外部審計員能夠逐步檢查並驗證模型行為。
  • Safety Guarantees: 當推理與內部過程對齊時,就更容易檢測出幻覺、邏輯錯誤或不安全的決策路徑。
  • Future Research: 研究結果顯示了一條通往可靠推理的路徑,這種推理可以用來證明模型輸出的可靠性,這是高風險應用程式的關鍵要求。

限制與開放性問題

  • 由於多次上下文切換,該方法可能會產生額外的計算開銷。
  • 雖然忠實度有所提升,但文章也承認性能並不總是能與最佳的 CoT 結果相匹配,這表明存在一個需要進一步研究的權衡。

相關 Anthropic 研究

  • Patterns and problems in emerging multi‑agent systems: 探討前沿模型中的系統性風險。
  • Reviewing the evidence on worker retraining programs: 與外部研究人員共同撰寫的政策導向評論。
  • Learning more about Claude's mathematical capabilities: 強調了 Claude 在貢獻數學研究方面的進步,例如改進與黎曼猜想相關的界限。

此摘要基於 Anthropic 於 2023 年 7 月 18 日發布的研究公告。

Sources

相關