camel-ai/loong
🐉 Loong: Synthesize Long CoTs at Scale through Verifiers.
解決的問題
Project Loong 透過使模型能夠自我引導智能,解決了擴展具備推理能力的模型的挑戰。它專注於生成高品質的合成數據並對其進行驗證,從而為 LLM 智能體建立自我改進循環,減少了對複雜推理任務中大規模人工標註數據集的依賴。
工作原理
該項目實現了一個由三個主要組件組成的智能體-環境循環:
- Generator:基於少量高品質種子數據集創建合成問題、推理過程 (rationale) 和答案。
- Verifier:評估生成回答的正確性,通常透過執行推理代碼並將輸出與已知答案進行比較來實現。
- Trainable Agent:利用強化學習 (RL) 與其他高級策略,從經過驗證的問答對中進行迭代學習,以提高其推理能力。
適用對象
專為對合成數據生成、強化學習以及具備推理能力的 LLM 智能體開發感興趣的 AI 研究人員與開發人員設計。
亮點
- 多樣化的種子數據集:包含來自 12 個領域的 8,700 多個問題,涵蓋高等數學、物理、化學、醫學與程式設計。
- 自動驗證:使用驗證器透過代碼執行來確保合成數據的準確性。
- 模組化 Cookbook:提供用於 few-shot prompting、合成數據生成以及為監督微調或 RL 匯出數據的可重用腳本。
- 協作框架:一個鼓勵貢獻新種子數據集與驗證器的開源倡議。
相關
- 專案
- 專案
- 專案
- 專案
- 專案