Mapika/decider
A family of System One-style models fine-tuned from Qwen3.5, designed for one-pass typed decisions with calibrated probabilities.
decider – 單次傳遞的類型化決策,帶有校準概率
它是什麼 – decider 是一系列語言模型檢查點,不生成自由形式的文本。相反,它們接受一個狀態(純文本或 JSON)和一個類型化問題列表,並在單次前向傳播中為每個問題輸出概率分佈。支援的問題類型有:
- 選擇 – 從 2-255 個候選項中選擇一個。
- 評分 – 為一個小的有序等級集(2-10)分配概率。
- 是否 – 給出答案為「是」的概率。
由於模型永遠不需要解碼超出固定標籤 token 集的 token,推理速度快,且概率是校準的(在一個小的基於 RL 的微調階段後,模型的置信度與觀察到的準確率匹配)。
主要能力
| 功能 | 重要性 |
|---|---|
| 單次傳遞推理 | 所有問題一起回答;無需迭代提示或思維鏈。 |
| 類型化輸出 | 保證答案始終是預定義選項之一 – 無需後處理。 |
| 校準感知 RL (v10) | 改善置信度分數與真實正確性之間的匹配,特別是在決策任務上。 |
| 多種模型大小 | 0.8 B、2 B、4 B(密集)和 35 B 混合專家,加上 2 B 視覺語言變體。 |
| 硬體靈活性 | 可在 CUDA(bf16,可選 FP8)、Apple Silicon(透過 MPS/MLX)和 CPU(eager 模式)上運行。 |
| HTTP 伺服器 | 簡單的 POST /v1/systemone(TypeSafe 線格式)或 POST /decide 端點;對重複的 schema 進行 schema 快取以加速重複呼叫。 |
| 開源訓練流程 | 下載約 95 個公共決策資料集、建立混合資料集並微調 Qwen 基礎模型的腳本。 |
典型使用案例
- 客戶服務路由 – 輸入工單和政策文本,詢問「哪個部門應該處理這個?」並獲得帶有置信度的校準選擇。
- 風險評分 – 詢問「使用者有多沮喪?」或「欺詐的可能性是多少?」並獲得每個評分等級的概率。
- 遊戲代理 – 儲存庫包含示範,模型在文本遊戲、Atari Pong(從 RAM 衍生的文本)和 Super Mario Bros 中決定動作,每個動作只需單次前向傳播。
- 視覺問答 –
decider-2b-vision檢查點可以回答基於圖像的查詢,返回每個選項的概率。 - 批次分類流程 – HTTP 伺服器的 schema 快取使得對多條記錄運行相同的問題集成本低廉。
快速開始(Python)
pip install decider-ai # 或:pip install -e .[serve,train]
from decider.infer import Decider
# 載入檢查點(首次使用時從 Hugging Face 下載)
model = Decider("Mapika/decider-2b")
state = {
"ticket": {"messages": [{"from": "customer", "text": "I was charged twice for order A‑104."}]},
"refund_policy": "Duplicate charges are eligible for a refund."
}
questions = {
"department": {"type": "choice", "instructions": "Which team should handle this?",
"criteria": {"returns": "Exchanges, refunds, wrong or damaged items",
"billing": {"what": "Charges, invoices", "not_for": "delivery"},
"other": None}},
"refund_requested": {"type": "noul", "instructions": "Does the ticket request a refund?"},
"frustration": {"type": "score", "instructions": "How frustrated is the customer?",
"criteria": ["calm", "frustrated", "very frustrated"]}
}
result = model.system_one(state, questions)
print(result)
輸出包含每個類型化問題的概率分佈,例如一個 choice 帶有置信度和完整的選項概率向量。
透過 HTTP 提供服務
scripts/serve.sh Mapika/decider-2b 8000
POST /v1/systemone– 與 TypeSafe AI SDK 相容。POST /decide– README 範例中使用的純 JSON 格式。- 伺服器自動選擇最佳裝置(CUDA → MPS → CPU),在 CUDA 上,為每個(批次,長度)形狀捕獲 CUDA 圖,以實現零執行時編譯開銷。
訓練自己的模型
儲存庫包含完整的資料建置和微調程式碼:
scripts/train.sh full建置公共混合資料集(約 1.5 M 範例,455 M tokens)並在 Qwen-3.5 基礎上運行一個 epoch。scripts/train.sh delta <existing-ckpt>從檢查點繼續訓練,適用於新增決策資料集。- 可選的 RL 階段(v8 → v10)使用即時 MiniWoB++ 瀏覽器任務進一步校準概率;RL 迴圈位於單獨的研究儲存庫中,但 README 連結到所需環境。
已知限制(如儲存庫所述)
- 無多步驟推理 – 模型無法執行鏈式算術或多跳推理;將此類問題拆分為單獨的問題。
- 困難項目標準下降 – 特別是在知識密集型多選題(例如 GPQA、GSM8K)上。2 B 模型在最困難的基準項目上表現出明顯的過度自信。
- 僅英文 – 所有訓練資料和評估均為英文;其他語言的效能未記錄。
- Schema 快取以準確性換取速度 – 啟用快取可能會降低某些 schema 的答案品質。
- 視覺變體仍在開發中 –
decider-2b-vision使用較舊的文本權重,正在重新訓練。 - 教師偏差 – 自訂問題資料由 27 B 教師模型標記,這引入了某種偏差(與其自身標籤的約 72% 一致性)。
更多資訊
- Hugging Face 上的模型卡:
Mapika/decider-2b、decider-4b、decider-35b-a3b等。 - 詳細基準表:
docs/RESULTS.md。 - 變更日誌和 RL 詳細資訊:
docs/CHANGELOG.md、docs/RL.md。 - 示範筆記本和範例程式:
examples/。
底線 – decider 提供了一個實用、開源的替代方案,取代傳統的文本生成 LLM,當您需要在固定選項集上進行快速、校準的決策時。它特別適用於路由、評分和簡單的遊戲任務,並且可以在 GPU、Apple Silicon 甚至 CPU 上運行。
相關
- 專案
- 專案
- 專案
- 專案