TianyuCodings/NanoJev
A nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline.
해결하는 문제
NanoJev는 전통적인 토큰 단위 디코딩 없이 의사결정 작업을 처리할 수 있도록 설계된 Jev 모델의 소규모 복제본입니다. 상태와 질문을 입력으로 받아 후보군에 대한 완전한 확률 분포를 직접 출력함으로써, 미로나 스네이크 게임과 같은 환경에서 더 빠르고 구조적인 의사결정을 가능하게 합니다.
작동 방식
0.6B 파라미터의 Qwen3 백본을 기반으로 하며, 표준 언어 모델 헤드 대신 전용 의사결정 헤드를 사용합니다. 여러 상태와 질문을 한 번의 포워드 패스로 처리할 수 있어 독립적인 의사결정을 배치 처리할 수 있습니다. 세 가지 유형의 의사결정을 지원합니다:
- 동적 선택: 2~255개 후보에 대한 확률을 제공합니다.
- 부울 결정: 주장이 참일 확률을 반환합니다.
- 순서 기반 점수: 2~10단계에 걸친 확률 가중 기대값을 반환합니다.
대상 사용자
이 프로젝트는 '시스템 1' 모델, 고효율 의사결정 모델, 그리고 AI 에이전트에서 로컬 판단과 코드 기반 계획의 통합에 관심이 있는 연구자 및 개발자에게 적합합니다.
주요 특징
- 출력 토큰 디코딩 없음: 의사결정은 포워드 패스에서 직접 읽어오며, 자기회귀 생성의 오버헤드가 없습니다.
- 0.6B LLM 백본: 구조화된 출력을 효율적으로 활용하는 Qwen3-0.6B를 사용합니다.
- 병렬 의사결정 처리: 한 번의 포워드 패스로 여러 쿼리(예: 6개 상태와 18개 질문)를 처리할 수 있습니다.
- 게임 기반 평가: 50x50 미로와 스네이크 게임에서 성공을 입증했으며, 조정되지 않은 기본 모델보다 종종 우수합니다.
- 교정된 의사결정: 쌍체 적절 보상 학습과 Brier 점수 학습 구현을 포함하여 확률의 품질을 향상시킵니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트