TokenRhythm/NeoHorse
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.
해결하는 문제
NeoHorse-1은 재귀적 자기 개선(RSI)이 가능한 모델을 구축하는 도전 과제를 해결합니다. 정적 학습을 넘어서, 에이전트 작업, 도구 사용, 코딩에서의 실제 성능을 기반으로 모델을 평가하고, 선택하며 업데이트하는 루프를 구축하는 것을 목표로 합니다.
작동 방식
NeoHorse-1은 다양한 모델을 관리하는 풀을 운영하는 '라우팅 해너스'를 사용합니다. 이 해너스는 작업을 할당하고, 도구 사용 및 결과를 기록하며, 특정 능력에 대한 수요를 추정합니다. 이 피드백은 다음 학습 믹스에 피드백됩니다. 프로젝트는 라우팅 가이드 커리큘럼 SFT(Supervised Fine-Tuning)와 온폴리시 디스틸레이션을 특징으로 하는 에이전트 기반 포스트 트레이닝 프레임워크를 채택하여, 실행 트래잭터리를 학습 신호로 변환하면서 해너스의 맥락을 유지합니다.
대상 사용자
에이전트 네이티브한 인과 언어 모델에 집중하는 개발자 및 연구자들을 위한 것으로, 특히 도구 사용 및 지시 따르기 작업에 적합한 효율적인 로컬 배포(4B 모델) 또는 더 높은 용량(9B 모델)을 필요로 하는 사용자에게 적합합니다.
주요 특징
- 재귀적 자기 개선 프로토타입: 평가–선택–업데이트 루프를 구현하여 모델 능력을 반복적으로 향상시킵니다.
- 에이전트 기반 포스트 트레이닝: 라우팅 가이드 커리큘럼 SFT와 온폴리시 디스틸레이션을 사용하여 모델을 정교화합니다.
- 고품질 데이터 파이프라인: 엄격한 중복 제거, 평가 데이터 오염 제거, 그리고 시나리오/목표/결과 수준의 라벨링을 포함합니다.
- 유연한 배포: GGUF 및 양자화 버전을 포함한 4B 및 9B 파라미터 크기로 제공되어 로컬 하드웨어에서의 실행이 용이합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트