camel-ai/loong

🐉 Loong: Synthesize Long CoTs at Scale through Verifiers.

解決的問題

Project Loong 透過使模型能夠自我引導智能,解決了擴展具備推理能力的模型的挑戰。它專注於生成高品質的合成數據並對其進行驗證,從而為 LLM 智能體建立自我改進循環,減少了對複雜推理任務中大規模人工標註數據集的依賴。

工作原理

該項目實現了一個由三個主要組件組成的智能體-環境循環:

  1. Generator:基於少量高品質種子數據集創建合成問題、推理過程 (rationale) 和答案。
  2. Verifier:評估生成回答的正確性,通常透過執行推理代碼並將輸出與已知答案進行比較來實現。
  3. Trainable Agent:利用強化學習 (RL) 與其他高級策略,從經過驗證的問答對中進行迭代學習,以提高其推理能力。

適用對象

專為對合成數據生成、強化學習以及具備推理能力的 LLM 智能體開發感興趣的 AI 研究人員與開發人員設計。

亮點

  • 多樣化的種子數據集:包含來自 12 個領域的 8,700 多個問題,涵蓋高等數學、物理、化學、醫學與程式設計。
  • 自動驗證:使用驗證器透過代碼執行來確保合成數據的準確性。
  • 模組化 Cookbook:提供用於 few-shot prompting、合成數據生成以及為監督微調或 RL 匯出數據的可重用腳本。
  • 協作框架:一個鼓勵貢獻新種子數據集與驗證器的開源倡議。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案