camel-ai/loong

🐉 Loong: Synthesize Long CoTs at Scale through Verifiers.

解决的问题

Project Loong 通过使模型能够自我引导智能,解决了扩展具备推理能力模型的挑战。它专注于生成高质量的合成数据并对其进行验证,从而为 LLM 智能体创建自我改进循环,减少了对复杂推理任务中大规模人工标注数据集的依赖。

工作原理

该项目实现了一个由三个主要组件组成的智能体-环境循环:

  1. Generator:基于少量高质量种子数据集创建合成问题、推理过程(rationale)和答案。
  2. Verifier:评估生成回答的正确性,通常通过执行推理代码并将输出与已知答案进行比较来实现。
  3. Trainable Agent:利用强化学习 (RL) 和其他高级策略,从经过验证的问答对中进行迭代学习,以提高其推理能力。

适用对象

专为对合成数据生成、强化学习以及具备推理能力的 LLM 智能体开发感兴趣的 AI 研究人员和开发人员设计。

亮点

  • 多样化的种子数据集:包含来自 12 个领域的 8,700 多个问题,涵盖高等数学、物理、化学、医学和编程。
  • 自动验证:使用验证器通过代码执行来确保合成数据的准确性。
  • 模块化 Cookbook:提供用于 few-shot prompting、合成数据生成以及为监督微调或 RL 导出数据的可重用脚本。
  • 协作框架:一个鼓励贡献新种子数据集和验证器的开源倡议。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目