TokenRhythm/NeoHorse

NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.

解决的问题

NeoHorse-1 解决了构建具备递归自我改进(RSI)能力模型的挑战。其目标是超越静态训练,建立一个循环:模型根据其在代理任务、工具使用和编程中的实际表现进行评估、选择和更新。

工作原理

NeoHorse-1 使用“路由 harness”来管理一组不同的模型。该 harness 负责分配任务,记录工具使用情况和结果,并估算特定能力的需求。这些反馈随后被输入到下一轮训练混合模型中。该项目采用基于代理的后训练框架,包含路由引导的课程式监督微调(SFT)和策略内蒸馏,将执行轨迹转化为训练信号,同时保持 harness 的上下文。

适用人群

专为关注代理原生因果语言模型的开发者和研究人员设计,特别适合需要高效本地部署(4B 模型)或更高容量(9B 模型)以应对工具使用和指令遵循任务的用户。

主要亮点

  • 递归自我改进原型:实现评估–选择–更新循环,迭代提升模型能力。
  • 代理后训练:采用路由引导的课程式监督微调(SFT)和策略内蒸馏,优化模型表现。
  • 高质量数据流水线:包含严格的去重、评估去污染,以及场景/目标/结果级别的标注。
  • 灵活部署:提供 4B 和 9B 参数规模版本,支持 GGUF 和量化版本,便于在本地硬件上运行。

相关

  • 项目
  • 项目
  • 项目
  • 项目