Kev:基於 Qwen3.5 構建的開源決策模型
Kev 是一系列小型決策模型,專為高速、結構化的分類與評分任務而設計。Kev 基於 Qwen3.5 基礎模型構建,採用了受 Jev 啟發的架構,允許使用者在單次前向傳遞中,針對單一輸入文字執行多個決策問題(是非題、選擇題與評分題)。
架構與實作
Kev 在 Qwen 基礎模型之上使用了 rank-16 LoRA 適配器與自定義指標頭(pointer head)。該系統旨在透過處理一次輸入狀態並重複利用該計算結果來處理多個獨立問題,從而最大化效率。
問題隔離與處理
對於僅具備注意力機制的基礎模型(如 Qwen3),Kev 使用特定的注意力遮罩,允許 Token 讀取輸入狀態及其自身的問題,但防止其讀取其他問題。這確保了問題之間保持獨立,互不影響。
對於整合了 Gated DeltaNet 層(忽略注意力遮罩的遞迴層)的 Qwen3.5 模型,Kev 將每個問題視為獨立的行進行處理。伺服器計算一次狀態並為每一行重複使用快取,從而維持問題之間的精確隔離。
指標頭(Pointer Head)
Kev 不會生成文字 Token,而是使用指標頭來對比每個選項結束標籤 (</opt>) 的隱藏狀態與問題決策 Token (<decide>) 的隱藏狀態進行評分。隨後,Softmax 函數會將這些分數轉換為機率,為每個答案提供校準後的信心水準。
模型系列與效能
Kev 提供三種尺寸:0.8B、4B 與 9B。這三種模型皆使用相同的資料與設定進行訓練,讓使用者能根據記憶體與準確度需求選擇模型。
基準測試與準確度
Kev-9B 是效能最強的模型,在測試集上達到了 0.852 的準確度。雖然在新來源開發集上比託管的 Jev 模型落後 3.5 個百分點(0.822 對比 0.857),但它展現了對未見過的政策規則類型的強大泛化能力。
| 模型 | 基礎 | 準確度(新來源 - 測試) | Brier 分數(新來源 - 測試) |
|---|---|---|---|
| Kev-0.8B | Qwen3.5-0.8B | 0.684 | 0.460 |
| Kev-4B | Qwen3.5-4B | 0.837 | 0.255 |
| Kev-9B | Qwen3.5-9B | 0.852 | 0.237 |
推論效能
延遲會因硬體而有顯著差異。在 CUDA (H100) 上,五個問題的請求僅需數十毫秒。在 Apple Silicon 上,由於缺乏 DeltaNet 層的快速核心,9B 模型每個請求大約需要 2 秒,而 4B 模型大約需要 779ms。若在 Mac 上有低延遲需求,建議使用上一代基於 Qwen3 的模型。
API 與整合
Kev 的 API 與 TypeSafe 的 System One 相容,可與 TypeSafe Python SDK 無縫整合。/v1/systemone 端點接受一個 state(待評估文字)與一組 questions。
支援的問題類型
- noul:二元是非題,回傳「是」的機率。
- choice:選擇題,回傳最可能的選項、所有選項的機率以及信心分數。
- score:評分題,回傳平均水準索引、圖例與機率。
訓練與微調
Kev 使用正確答案的交叉熵進行訓練,基礎權重保持不變,同時訓練適配器與指標頭。
自定義微調
使用者可以使用 JSONL 格式在自己的特定領域資料上微調 Kev。作者建議使用 --init_from 旗標來載入已發布檢查點的適配器與指標頭。這能在增加領域特定知識的同時,保留模型的一般決策能力。在一項測試中,從基礎模型微調的分數在 Kev 的評估集上僅為 0.33,而從已發布檢查點微調則維持了 0.83 的準確度,並在新領域達到了 0.88。
限制與考量
- 校準:原始機率在新來源上可能會過於自信。使用
KEV_TEMPERATURE=2.0可以將 Kev-9B 的自信錯誤(機率 $\ge 0.9$ 的錯誤答案)從 8.7% 降低至 4.4%。 - 日期運算:模型在處理原始日期減法時較為吃力。設定
KEV_DATE_FACTS=1會附加絕對日期之間的天數,將 Kev-9B 在截止日期政策問題上的準確度從 0.80 提升至 0.90。 - 選項順序:儘管有問題隔離,單一問題內選項順序的變更仍可能影響答案。
- 知識差距:與 Jev 相比,通用知識 (MMLU) 存在顯著差距,這歸因於基礎模型的限制。
社群見解
開發者之間的討論指出,類似 Jev 的模型對於內部路由邏輯、資料標記以及減少代理工作流程中的工具呼叫開銷特別有用。一位使用者提到,他們使用代理將提示路由至 Jev 以在發送至前沿模型前縮小工具範圍,從而減少了 60% 的工具呼叫。
然而,一些評論者認為 Jev 的核心價值在於其訓練資料而非架構,暗示開源衍生模型若沒有類似的高品質資料集,可能難以達到原始託管模型的效能。
Sources
相關
- 專案
- 專案
- Dispatch
- 專案
- Dispatch