facebookresearch/deepconf

DeepConf: Deep Think with Confidence

解决的问题

DeepConf 致力于解决提高大语言模型 (LLM) 在数学、科学和编程等复杂任务中推理准确性的挑战。它旨在通过并行思维(生成多条推理路径)并利用基于置信度的停止机制高效管理计算预算,从而提高回答的可靠性。

工作原理

DeepConf 作为 vLLM 等 LLM 服务后端的外壳运行。它实现了一个可以以两种模式运行的并行思维框架:

  • Online Mode:使用一组预热轨迹来建立置信度阈值。一旦达到足够的置信度水平,它会应用提前停止来停止生成,从而节省计算资源。
  • Offline Mode:一次性生成一批推理轨迹(预算),并应用各种投票和聚合策略来确定最可能的正确答案。

适用对象

希望通过集成方法(投票)提高回答准确性,并使用基于置信度的提前停止来优化推理成本的推理密集型 LLM 开发者和研究人员。

亮点

  • vLLM Integration:完全兼容 vLLM 的初始化参数和服务后端。
  • Confidence-Based Early Stopping:在在线模式下,当达到置信度阈值时停止,从而减少不必要的计算。
  • Flexible Voting Strategies:支持多种聚合方法,从并行推理轨迹中选择最终答案。
  • Comprehensive Output:为每次运行提供详细的元数据,包括置信度条、Token 使用情况和耗时统计。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch