TianyuCodings/NanoJev
A nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline.
解决的问题
NanoJev 是 Jev 模型的小规模复制品,旨在无需传统逐 token 解码即可处理决策任务。它能够接收状态和问题输入,并直接输出一组候选项的完整概率分布,从而在迷宫和贪吃蛇游戏等环境中实现更快、更结构化的决策。
工作原理
基于 0.6B 参数的 Qwen3 骨干网络,NanoJev 使用专用的决策头而非标准语言模型头。它可以在一次前向传播中处理多个状态和问题,支持独立决策的批量处理。支持三种类型的决策:
- 动态选择: 提供 2 到 255 个候选项的概率。
- 布尔决策: 返回某个命题为真的概率。
- 有序评分: 返回 2 到 10 个等级之间的概率加权期望值。
适用人群
本项目适用于对「系统一」模型、高效率决策模型,以及 AI 代理中本地判断与代码化规划集成感兴趣的科研人员和开发者。
亮点
- 零输出 token 解码: 决策直接从前向传播中读取,消除了自回归生成的开销。
- 0.6B LLM 骨干: 高效利用 Qwen3-0.6B 实现结构化输出。
- 并行决策处理: 可在一次前向传播中处理多个查询(例如 6 个状态和 18 个问题)。
- 基于游戏的评估: 在 50x50 迷宫和贪吃蛇游戏中表现成功,通常优于未调优的基线模型。
- 校准的决策: 包含配对适当奖励学习和 Brier 分数训练的实现,以提升概率质量。
相关
- 项目
- 项目
- 项目
- 项目