nolabs-ai/deepfabric
Generate High-Quality Synthetics, Train, Measure, and Evaluate in a Single Pipeline
What it solves
DeepFabric 解決了為語言模型建立高品質、多樣化合成訓練數據的挑戰,特別是針對工具調用(tool-calling)和推理等代理行為(agentic behaviors)。它透過確保數據集是以領域為錨點,並基於真實的工具執行結果而非模擬輸出,來防止模型過擬合和幻覺。
How it works
該系統使用獨特的佈題圖譜生成算法來規劃領域並確保子主題的全面覆蓋且不重複。接著,它使用 ReAct (Reason-Act-Observe) 循環來生成訓練樣本。為了確保準確性,它與 Spin Framework 集成,在隔離的 WebAssembly 沙箱中執行工具,這意味著模型的「觀察」是基於虛擬文件系統中的實際狀態變化。生成的數據可以導出到 Hugging Face 並與 TRL、Unsloth 或 Axolotl 等訓練框架配合使用。最後,它包含一個內置的評估引擎,用於在未見過的任務上測試微調後的模型在工具選擇和參數準確性方面的表現。
Who it’s for
它專為開發者和 AI 研究人員設計,特別是那些需要微調 LLM 作為代理(agents)的人,例如需要教導模型如何使用工具、遵循嚴格的 schema、以及在特定領域執行複雜規劃的人。
Highlights
- Topic Graph Generation: 使用圖譜和樹狀結構來確保 100% 的主題覆蓋率並避免冗餘樣本。
- Real Tool Execution: 與 WebAssembly (Spin) 集成,提供真實的工具調用軌跡,而非幻覺式的模擬。
- MCP Support: 可以從 Model Context Protocol (MCP) 伺服器 schema 導入工具定義。
- Integrated Evaluation: 提供專用引擎來衡量工具選擇準確性、參數準確性以及執行成功率。
- Training Pipeline Integration: 直接兼容 Hugging Face 和流行的 SFT (Supervised Fine-Tuning) 框架。