camel-ai/loong

🐉 Loong: Synthesize Long CoTs at Scale through Verifiers.

해결하는 문제

Project Loong은 모델이 스스로 지능을 부트스트랩할 수 있도록 함으로써 추론 능력을 갖춘 모델의 확장 문제를 해결합니다. 이 프로젝트는 고품질의 합성 데이터를 생성하고 이를 검증하여 LLM 에이전트를 위한 자기 개선 루프를 만드는 데 중점을 두며, 복잡한 추론 작업을 위한 대규모 인간 주석 데이터 세트에 대한 의존도를 줄입니다.

작동 방식

이 프로젝트는 세 가지 주요 구성 요소로 구성된 에이전트-환경 루프를 구현합니다:

  1. Generator: 소규모의 고품질 시드 데이터 세트를 기반으로 합성 질문, 근거 및 답변을 생성합니다.
  2. Verifier: 생성된 응답의 정확성을 평가하며, 종종 근거 코드를 실행하고 출력을 알려진 답변과 비교하여 수행합니다.
  3. Trainable Agent: 강화 학습(RL) 및 기타 고급 전략을 사용하여 검증된 Q&A 쌍으로부터 반복적으로 학습하여 추론 능력을 향상시킵니다.

대상

합성 데이터 생성, 강화 학습 및 추론 능력을 갖춘 LLM 에이전트 개발에 관심이 있는 AI 연구자 및 개발자를 위해 설계되었습니다.

주요 특징

  • 다양한 시드 데이터 세트: 고급 수학, 물리학, 화학, 의학 및 프로그래밍을 포함한 12개 도메인에 걸쳐 8,700개 이상의 질문이 포함되어 있습니다.
  • 자동 검증: 검증기를 사용하여 코드 실행을 통해 합성 데이터의 정확성을 보장합니다.
  • 모듈형 쿡북: Few-shot 프롬프팅, 합성 데이터 생성 및 지도 미세 조정 또는 RL을 위한 데이터 내보내기에 사용되는 재사용 가능한 스크립트를 제공합니다。
  • 협업 프레임워크: 새로운 시드 데이터 세트 및 검증기 기여를 장려하는 오픈 소스 이니셔티브입니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트