TianyuCodings/NanoJev

A nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline.

解决的问题

NanoJev 是 Jev 模型的小规模复制品,旨在无需传统逐 token 解码即可处理决策任务。它能够接收状态和问题输入,并直接输出一组候选项的完整概率分布,从而在迷宫和贪吃蛇游戏等环境中实现更快、更结构化的决策。

工作原理

基于 0.6B 参数的 Qwen3 骨干网络,NanoJev 使用专用的决策头而非标准语言模型头。它可以在一次前向传播中处理多个状态和问题,支持独立决策的批量处理。支持三种类型的决策:

  • 动态选择: 提供 2 到 255 个候选项的概率。
  • 布尔决策: 返回某个命题为真的概率。
  • 有序评分: 返回 2 到 10 个等级之间的概率加权期望值。

适用人群

本项目适用于对「系统一」模型、高效率决策模型,以及 AI 代理中本地判断与代码化规划集成感兴趣的科研人员和开发者。

亮点

  • 零输出 token 解码: 决策直接从前向传播中读取,消除了自回归生成的开销。
  • 0.6B LLM 骨干: 高效利用 Qwen3-0.6B 实现结构化输出。
  • 并行决策处理: 可在一次前向传播中处理多个查询(例如 6 个状态和 18 个问题)。
  • 基于游戏的评估: 在 50x50 迷宫和贪吃蛇游戏中表现成功,通常优于未调优的基线模型。
  • 校准的决策: 包含配对适当奖励学习和 Brier 分数训练的实现,以提升概率质量。

相关

  • 项目
  • 项目
  • 项目
  • 项目