facebookresearch/deepconf
DeepConf: Deep Think with Confidence
解決的問題
DeepConf 致力於解決提高大型語言模型 (LLM) 在數學、科學與程式設計等複雜任務中推理準確性的挑戰。它旨在透過平行思考(生成多條推理路徑)並利用基於置信度的停止機制高效管理計算預算,從而提高回答的可靠性。
工作原理
DeepConf 作為 vLLM 等 LLM 服務後端的封裝器運行。它實現了一個可以以兩種模式運行的平行思考框架:
- Online Mode:使用一組預熱軌跡來建立置信度閾值。一旦達到足夠的置信度水平,它會應用提前停止來停止生成,從而節省計算資源。
- Offline Mode:一次性生成一批推理軌跡(預算),並應用各種投票與聚合策略來確定最可能的正確答案。
適用對象
希望透過集成方法(投票)提高回答準確性,並使用基於置信度的提前停止來優化推理成本的推理密集型 LLM 開發者與研究人員。
亮點
- vLLM Integration:完全相容 vLLM 的初始化參數與服務後端。
- Confidence-Based Early Stopping:在線上模式下,當達到置信度閾值時停止,從而減少不必要的計算。
- Flexible Voting Strategies:支援多種聚合方法,從平行推理軌跡中選擇最終答案。
- Comprehensive Output:為每次執行提供詳細的元數據,包括置信度條、Token 使用情況與耗時統計。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch