facebookresearch/deepconf

DeepConf: Deep Think with Confidence

해결하는 문제

DeepConf는 수학, 과학, 코딩과 같은 복잡한 작업에서 대규모 언어 모델(LLM)의 추론 정확도를 향상시키는 과제를 해결합니다. 병렬 사고(여러 추론 경로 생성)를 사용하고 신뢰도 기반 중단을 통해 계산 예산을 효율적으로 관리함으로써 답변의 신뢰성을 높이는 것을 목표로 합니다.

작동 방식

DeepConf는 vLLM과 같은 LLM 서빙 백엔드의 래퍼 역할을 합니다. 다음과 같은 두 가지 모드로 작동할 수 있는 병렬 사고 프레임워크를 구현합니다.

  • Online Mode: 워밍업 트레이스를 사용하여 신뢰도 임계값을 설정합니다. 그 후, 충분한 신뢰 수준에 도달하면 생성을 중단하는 조기 종료를 적용하여 계산량을 절약합니다.
  • Offline Mode: 추론 트레이스 배치(예산)를 한 번에 생성하고 다양한 투표 및 집계 전략을 적용하여 가장 가능성 있는 정답을 결정합니다.

대상 사용자

앙상블 방법(투표)을 통해 답변 정확도를 높이고 신뢰도 기반 조기 종료를 사용하여 추론 비용을 최적화하고자 하는 추론 중심 LLM 개발자 및 연구자.

주요 특징

  • vLLM Integration: vLLM 초기화 매개변수 및 서빙 백엔드와 완전히 호환됩니다.
  • Confidence-Based Early Stopping: 신뢰도 임계값이 충족될 때 중단하여 온라인 모드에서의 불필요한 계산을 줄입니다.
  • Flexible Voting Strategies: 병렬 추론 트레이스에서 최종 답변을 선택하기 위한 다양한 집계 방법을 지원합니다.
  • Comprehensive Output: 모든 실행에 대해 신뢰도 바, 토큰 사용량 및 타이밍 통계를 포함한 상세한 메타데이터를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch