facebookresearch/deepconf
DeepConf: Deep Think with Confidence
解决的问题
DeepConf 致力于解决提高大语言模型 (LLM) 在数学、科学和编程等复杂任务中推理准确性的挑战。它旨在通过并行思维(生成多条推理路径)并利用基于置信度的停止机制高效管理计算预算,从而提高回答的可靠性。
工作原理
DeepConf 作为 vLLM 等 LLM 服务后端的外壳运行。它实现了一个可以以两种模式运行的并行思维框架:
- Online Mode:使用一组预热轨迹来建立置信度阈值。一旦达到足够的置信度水平,它会应用提前停止来停止生成,从而节省计算资源。
- Offline Mode:一次性生成一批推理轨迹(预算),并应用各种投票和聚合策略来确定最可能的正确答案。
适用对象
希望通过集成方法(投票)提高回答准确性,并使用基于置信度的提前停止来优化推理成本的推理密集型 LLM 开发者和研究人员。
亮点
- vLLM Integration:完全兼容 vLLM 的初始化参数和服务后端。
- Confidence-Based Early Stopping:在在线模式下,当达到置信度阈值时停止,从而减少不必要的计算。
- Flexible Voting Strategies:支持多种聚合方法,从并行推理轨迹中选择最终答案。
- Comprehensive Output:为每次运行提供详细的元数据,包括置信度条、Token 使用情况和耗时统计。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch