Anthropic 展示问题分解能提升模型生成推理的忠实度
TL;DR
Anthropic 证明了,通过提示大语言模型 (LLM) 将问题分解为更简单的子问题,所产生的推理比传统的思维链 (CoT) 提示更能忠实地反映模型的内部过程,同时保留了 CoT 的大部分性能增益。
为什么问题分解很重要
分解强制模型在不同的上下文中回答更简单的子问题,这极大地增加了模型陈述的推理与其实际计算之间的对齐程度。随着 LLM 处理的任务日益复杂,这种更高的忠实度对于验证正确性和安全性至关重要。
核心技术方法
- Decomposition Prompting: 与其要求模型生成单一、不间断的推理链,不如在提示词中指示模型将原始查询分解为一系列子问题。
- Separate Contexts: 每个子问题都在其各自的上下文中回答,防止模型混淆步骤或跳过推理。
- Aggregation: 最终答案由子答案汇总而成,在保持逻辑流的同时,使每个推理步骤都清晰明确。
相对于思维链的性能
- 基于分解的方法在标准问答基准测试中取得了强劲的结果,有时接近 CoT 的准确率。
- 至关重要的是,在最近提出的几种忠实度指标上,分解法优于 CoT,这表明生成的推理是模型内部决策过程更真实的追踪。
评估的忠实度指标
Anthropic 评估了这些方法,使用了多种旨在评估模型书面推理与其实际计算匹配程度的指标。虽然文章并未列出具体数字,但报告称,在使用分解法时,这些指标均有持续的改进。
对模型安全性和验证的意义
- Enhanced Auditing: 更忠实的推理追踪使外部审计员能够逐步检查和验证模型行为。
- Safety Guarantees: 当推理与内部过程对齐时,就更容易检测到幻觉、逻辑错误或不安全的决策路径。
- Future Research: 研究结果表明,通往能够可靠用于认证模型输出的推理路径,这对于高风险应用场景是关键要求。
局限性与开放性问题
- 由于多次上下文切换,该方法可能会产生额外的计算开销。
- 虽然忠实度有所提高,但文章承认性能并不总是能达到最佳的 CoT 结果,这表明存在一种权衡,值得进一步研究。
相关 Anthropic 研究
- Patterns and problems in emerging multi-agent systems: 探讨了前沿模型的系统性风险。
- Reviewing the evidence on worker retraining programs: 一项与外部研究人员共同撰写的政策导向型综述。
- Learning more about Claude's mathematical capabilities: 强调了 Claude 在为数学研究做出贡献方面的进展,例如改进与黎曼猜想相关的界限。
此摘要基于 Anthropic 于 2023 年 7 月 18 日发布的研究公告。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch