Anthropic 展示问题分解能提升模型生成推理的忠实度

TL;DR

Anthropic 证明了,通过提示大语言模型 (LLM) 将问题分解为更简单的子问题,所产生的推理比传统的思维链 (CoT) 提示更能忠实地反映模型的内部过程,同时保留了 CoT 的大部分性能增益。

为什么问题分解很重要

分解强制模型在不同的上下文中回答更简单的子问题,这极大地增加了模型陈述的推理与其实际计算之间的对齐程度。随着 LLM 处理的任务日益复杂,这种更高的忠实度对于验证正确性和安全性至关重要。

核心技术方法

  • Decomposition Prompting: 与其要求模型生成单一、不间断的推理链,不如在提示词中指示模型将原始查询分解为一系列子问题。
  • Separate Contexts: 每个子问题都在其各自的上下文中回答,防止模型混淆步骤或跳过推理。
  • Aggregation: 最终答案由子答案汇总而成,在保持逻辑流的同时,使每个推理步骤都清晰明确。

相对于思维链的性能

  • 基于分解的方法在标准问答基准测试中取得了强劲的结果,有时接近 CoT 的准确率。
  • 至关重要的是,在最近提出的几种忠实度指标上,分解法优于 CoT,这表明生成的推理是模型内部决策过程更真实的追踪。

评估的忠实度指标

Anthropic 评估了这些方法,使用了多种旨在评估模型书面推理与其实际计算匹配程度的指标。虽然文章并未列出具体数字,但报告称,在使用分解法时,这些指标均有持续的改进。

对模型安全性和验证的意义

  • Enhanced Auditing: 更忠实的推理追踪使外部审计员能够逐步检查和验证模型行为。
  • Safety Guarantees: 当推理与内部过程对齐时,就更容易检测到幻觉、逻辑错误或不安全的决策路径。
  • Future Research: 研究结果表明,通往能够可靠用于认证模型输出的推理路径,这对于高风险应用场景是关键要求。

局限性与开放性问题

  • 由于多次上下文切换,该方法可能会产生额外的计算开销。
  • 虽然忠实度有所提高,但文章承认性能并不总是能达到最佳的 CoT 结果,这表明存在一种权衡,值得进一步研究。

相关 Anthropic 研究

  • Patterns and problems in emerging multi-agent systems: 探讨了前沿模型的系统性风险。
  • Reviewing the evidence on worker retraining programs: 一项与外部研究人员共同撰写的政策导向型综述。
  • Learning more about Claude's mathematical capabilities: 强调了 Claude 在为数学研究做出贡献方面的进展,例如改进与黎曼猜想相关的界限。

此摘要基于 Anthropic 于 2023 年 7 月 18 日发布的研究公告。

Sources

相关