Kev:基于 Qwen3.5 的开源决策模型
Kev 是一组小型决策模型,专为高速、结构化分类和评分而设计。基于 Qwen3.5 基础模型构建,Kev 采用受 Jev 启发的架构,允许用户在单次前向传播中,对同一段输入文本执行多个决策问题(是/否、多选题和评分题)。
架构与实现
Kev 在 Qwen 基础模型上使用了秩为 16 的 LoRA 适配器和自定义指针头。该系统通过仅处理一次输入状态并复用该计算结果,以实现最大效率,支持多个独立问题的处理。
问题隔离与处理
对于仅使用注意力机制的基础模型(如 Qwen3),Kev 使用特定的注意力掩码,使每个标记能够读取输入状态和自身的问题,但阻止其读取其他问题。这确保了问题之间的独立性,互不干扰。
对于包含门控 DeltaNet 层(忽略注意力掩码的循环层)的 Qwen3.5 模型,Kev 将每个问题作为独立行处理。服务器仅计算一次状态,并为每一行复用缓存,从而保持问题间的完全隔离。
指针头
Kev 不生成文本标记,而是使用指针头,将每个选项闭合标签(</opt>)的隐藏状态与问题决策标记(<decide>)的隐藏状态进行评分。随后,通过 softmax 函数将这些得分转换为概率,为每个答案提供校准后的置信度水平。
模型家族与性能
Kev 提供三种尺寸:0.8B、4B 和 9B。三者均在相同数据和设置下训练,用户可根据内存和精度需求自由选择。
基准测试与准确率
Kev-9B 是性能最强的模型,在测试集上达到 0.852 的准确率。尽管在新源开发集上比托管的 Jev 模型低 3.5 个百分点(0.822 vs 0.857),但其在未见政策规则类型上的泛化能力表现出色。
| 模型 | 基础模型 | 准确率(新源 - 测试集) | Brier 得分(新源 - 测试集) |
|---|---|---|---|
| Kev-0.8B | Qwen3.5-0.8B | 0.684 | 0.460 |
| Kev-4B | Qwen3.5-4B | 0.837 | 0.255 |
| Kev-9B | Qwen3.5-9B | 0.852 | 0.237 |
服务性能
延迟因硬件而异。在 CUDA(H100)上,五问请求耗时数十毫秒。在 Apple Silicon 上,由于 DeltaNet 层缺乏快速内核,9B 模型每请求约需 2 秒,而 4B 模型约为 779ms。对于 Mac 上的低延迟需求,建议使用前代基于 Qwen3 的模型。
API 与集成
Kev 的 API 与 TypeSafe 的 System One 保持一致,可无缝集成 TypeSafe 的 Python SDK。/v1/systemone 端点接受一个 state(待评估的文本)和一组 questions。
支持的问题类型
- noul:二元是/否问题,返回“是”的概率。
- choice:多选题,返回最可能的选项、所有选项的概率以及置信度分数。
- score:评分题,返回平均等级索引、图例和概率。
训练与微调
Kev 使用交叉熵损失对正确答案进行训练,基础权重保持固定,仅训练适配器和指针头。
自定义微调
用户可使用 JSONL 格式在自有领域数据上对 Kev 进行微调。作者建议使用 --init_from 标志加载已发布检查点的适配器和指针头。这可保留模型的通用决策能力,同时注入领域知识。一项测试显示,从基础模型微调在 Kev 评估集上得分为 0.33,而从已发布检查点微调则保持 0.83 的准确率,并在新领域达到 0.88。
限制与注意事项
- 校准:新源上的原始概率可能过于自信。使用
KEV_TEMPERATURE=2.0可将 Kev-9B 的高置信错误率(概率 ≥ 0.9 的错误答案)从 8.7% 降至 4.4%。 - 日期计算:模型在原始日期减法上表现不佳。设置
KEV_DATE_FACTS=1会在绝对日期之间附加天数,使 Kev-9B 在截止日期政策问题上的准确率从 0.80 提升至 0.90。 - 选项顺序:即使在问题隔离下,单个问题中选项顺序的改变仍可能影响答案。
- 知识差距:与 Jev 相比,其在通用知识(MMLU)方面存在显著差距,这归因于基础模型的局限性。
社区洞察
开发者讨论表明,类似 Jev 的模型在内部路由逻辑、数据标注以及减少代理工作流中的工具调用开销方面尤为有用。一位用户指出,他们使用代理将提示路由至 Jev,以在发送至前沿模型前缩小工具范围,从而减少了 60% 的工具调用。
然而,一些批评者认为,Jev 的核心价值在于其训练数据而非架构,因此开源衍生模型若无类似高质量数据集,可能难以达到原始托管模型的性能水平。
Sources
相关
- 项目
- 项目
- Dispatch
- 项目
- Dispatch