Hugging Face 开放链式思考排行榜
Hugging Face 已推出 Open Chain of Thought(CoT)排行榜,这是一套专门的评估框架,旨在衡量链式思考提示在复杂推理任务上实际提升模型准确率的程度。与传统排行榜关注绝对准确率不同,此排行榜聚焦于推理过程本身带来的边际增益。
通过准确率提升衡量推理的影响
Open CoT 排行榜通过计算模型在有无 CoT 提示下的表现差异来评估其推理轨迹的有效性。此方法旨在将推理过程的影响与模型的基线知识分离开来。
准确率提升公式:
accuracy gain Δ = accuracy with CoT – accuracy w/o CoT
为了建立基线(无 CoT 的准确率),排行榜使用多项选择评估的对数似然准确率。此方法旨在更好地抵御训练数据污染;即使模型在训练期间见过某个答案,它仍可能难以生成有效的推理路径来得到该答案。
评估任务与基准
排行榜使用需要常识和通用推理的任务,确保即使是高性能的大语言模型也面临挑战。所有任务均以多项选择题的形式呈现。
评估套件包括:
- LogiQA: 包含原始版本的新翻译以及 2.0 版。
- LSAT: 包含分析推理、逻辑推理和阅读理解的子集。
这些任务大多来源于 AGIEval 基准,并通过 logikon-bench 重新发布。
CoT 生成模式与提示策略
为兼顾多样的 CoT 提示技术,排行榜采用模块化提示链,并在六种不同的“生成模式”(两种提示策略 × 三种解码参数组合)下测试模型。
提示策略
- Classic(经典): 先呈现问题,再给出指令 “Let’s think step by step.”
- Reflect(反思): 让模型先对问题进行一般性反思,然后再进行逐步求解。
解码参数
- 贪婪解码
- Beam search(n=2)
- Sampling(T=.3)
对于测试数据集中的每个示例,模型会在六种模式中各生成一条推理轨迹。排行榜报告每个模型/任务对在任一模式下实现的最佳边际准确率提升。
关键发现与洞察
对 30 种模型的初步评估揭示了关于开放 LLM 推理能力的若干趋势:
- 小模型的有效性: 相对较小的模型(例如 7B 参数)也能展现出有效的 CoT 推理。在某些情况下,像 Phi-2 这样的较小模型的 CoT 推理带来的准确率提升甚至超过了更大的模型如 Mixtral。
- 微调的影响: 指令微调和聊天微调显著提升性能。微调不仅提升了基线准确率(无 CoT),也增强了应用 CoT 时的边际增益。
- CoT 效果的不一致性: 并不存在普遍优越的 CoT 生成模式。策略的有效性随模型和任务而异,甚至在某些情况下,CoT 可能降低准确率,这表明实现稳健可靠的 CoT 仍是一个挑战。
未来发展与贡献
Hugging Face 正在寻求社区贡献,以在以下几个方面扩展排行榜:
- 模型提交: 开放 LLM 可通过排行榜 HF space 上的 Submission 选项卡提交评估。
- 分析工具: 开发 Open CoT Dashboard,用于可视化基线准确率、方差以及推理轨迹属性(如长度)。
- 扩展策略: 实现更多 CoT 模式,如 tree-of-thought、self-consistency、self-check 或 debate。
- 数据集扩展: 随着计算资源的提升,加入更具挑战性的推理任务。