TianyuCodings/NanoJev

A nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline.

해결하는 문제

NanoJev는 전통적인 토큰 단위 디코딩 없이 의사결정 작업을 처리할 수 있도록 설계된 Jev 모델의 소규모 복제본입니다. 상태와 질문을 입력으로 받아 후보군에 대한 완전한 확률 분포를 직접 출력함으로써, 미로나 스네이크 게임과 같은 환경에서 더 빠르고 구조적인 의사결정을 가능하게 합니다.

작동 방식

0.6B 파라미터의 Qwen3 백본을 기반으로 하며, 표준 언어 모델 헤드 대신 전용 의사결정 헤드를 사용합니다. 여러 상태와 질문을 한 번의 포워드 패스로 처리할 수 있어 독립적인 의사결정을 배치 처리할 수 있습니다. 세 가지 유형의 의사결정을 지원합니다:

  • 동적 선택: 2~255개 후보에 대한 확률을 제공합니다.
  • 부울 결정: 주장이 참일 확률을 반환합니다.
  • 순서 기반 점수: 2~10단계에 걸친 확률 가중 기대값을 반환합니다.

대상 사용자

이 프로젝트는 '시스템 1' 모델, 고효율 의사결정 모델, 그리고 AI 에이전트에서 로컬 판단과 코드 기반 계획의 통합에 관심이 있는 연구자 및 개발자에게 적합합니다.

주요 특징

  • 출력 토큰 디코딩 없음: 의사결정은 포워드 패스에서 직접 읽어오며, 자기회귀 생성의 오버헤드가 없습니다.
  • 0.6B LLM 백본: 구조화된 출력을 효율적으로 활용하는 Qwen3-0.6B를 사용합니다.
  • 병렬 의사결정 처리: 한 번의 포워드 패스로 여러 쿼리(예: 6개 상태와 18개 질문)를 처리할 수 있습니다.
  • 게임 기반 평가: 50x50 미로와 스네이크 게임에서 성공을 입증했으며, 조정되지 않은 기본 모델보다 종종 우수합니다.
  • 교정된 의사결정: 쌍체 적절 보상 학습과 Brier 점수 학습 구현을 포함하여 확률의 품질을 향상시킵니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트