TokenRhythm/NeoHorse

NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.

解決的問題

NeoHorse-1 解決了建立具備遞歸自我改進(RSI)能力模型的挑戰。其目標是超越靜態訓練,建立一個循環:模型根據其在代理任務、工具使用和程式設計中的實際表現進行評估、選擇與更新。

工作原理

NeoHorse-1 使用「路由 harness」來管理一組不同的模型。該 harness 負責分配任務,記錄工具使用情況與結果,並估算特定能力的需求。這些反饋隨後被輸入到下一轮訓練混合模型中。該項目採用基於代理的後訓練框架,包含路由引導的課程式監督微調(SFT)與策略內蒸餾,將執行軌跡轉化為訓練信號,同時保持 harness 的上下文。

適用對象

專為關注代理原生因果語言模型的開發者與研究人員設計,特別適合需要高效本地部署(4B 模型)或更高容量(9B 模型)以應對工具使用與指令遵循任務的使用者。

主要亮點

  • 遞歸自我改進原型:實現評估–選擇–更新循環,迭代提升模型能力。
  • 代理後訓練:採用路由引導的課程式監督微調(SFT)與策略內蒸餾,優化模型表現。
  • 高品質資料流水線:包含嚴格的去重、評估去污染,以及場景/目標/結果級別的標註。
  • 靈活部署:提供 4B 與 9B 參數規模版本,支援 GGUF 與量化版本,便於在本地硬體上執行。

相關

  • 專案
  • 專案
  • 專案
  • 專案