TianyuCodings/NanoJev
A nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline.
解決的問題
NanoJev 是 Jev 模型的小型複製版,設計用於在不需要傳統逐 token 解碼的情況下處理決策任務。它能接收狀態與問題輸入,並直接輸出一組候選項的完整機率分佈,進而在迷宮與貪吃蛇遊戲等環境中實現更快、更具結構性的決策。
工作原理
基於 0.6B 參數的 Qwen3 骨幹,NanoJev 使用專用的決策頭而非標準語言模型頭。它能在一次前向傳播中處理多個狀態與問題,支援獨立決策的批量處理。支援三種類型的決策:
- 動態選擇: 提供 2 到 255 個候選項的機率。
- 布林決策: 回傳某個命題為真的機率。
- 有序分數: 回傳 2 到 10 級之間的機率加權期望值。
適用對象
本專案適合對「系統一」模型、高效率決策模型,以及 AI 代理中本地判斷與程式化規劃整合感興趣的研究人員與開發者。
亮點
- 零輸出 token 解碼: 決策直接從前向傳播中讀取,消除自回歸生成的開銷。
- 0.6B LLM 骨幹: 高效利用 Qwen3-0.6B 實現結構化輸出。
- 並行決策處理: 可在一次前向傳播中處理多個查詢(例如 6 個狀態與 18 個問題)。
- 遊戲導向評估: 在 50x50 迷宮與貪吃蛇遊戲中表現成功,通常優於未調校的基線模型。
- 校準的決策: 包含配對適當獎勵學習與 Brier 分數訓練的實作,以提升機率品質。
相關
- 專案
- 專案
- 專案
- 專案