Kev:基于 Qwen3.5 的开源决策模型

Kev 是一组小型决策模型,专为高速、结构化分类和评分而设计。基于 Qwen3.5 基础模型构建,Kev 采用受 Jev 启发的架构,允许用户在单次前向传播中,对同一段输入文本执行多个决策问题(是/否、多选题和评分题)。

架构与实现

Kev 在 Qwen 基础模型上使用了秩为 16 的 LoRA 适配器和自定义指针头。该系统通过仅处理一次输入状态并复用该计算结果,以实现最大效率,支持多个独立问题的处理。

问题隔离与处理

对于仅使用注意力机制的基础模型(如 Qwen3),Kev 使用特定的注意力掩码,使每个标记能够读取输入状态和自身的问题,但阻止其读取其他问题。这确保了问题之间的独立性,互不干扰。

对于包含门控 DeltaNet 层(忽略注意力掩码的循环层)的 Qwen3.5 模型,Kev 将每个问题作为独立行处理。服务器仅计算一次状态,并为每一行复用缓存,从而保持问题间的完全隔离。

指针头

Kev 不生成文本标记,而是使用指针头,将每个选项闭合标签(</opt>)的隐藏状态与问题决策标记(<decide>)的隐藏状态进行评分。随后,通过 softmax 函数将这些得分转换为概率,为每个答案提供校准后的置信度水平。

模型家族与性能

Kev 提供三种尺寸:0.8B、4B 和 9B。三者均在相同数据和设置下训练,用户可根据内存和精度需求自由选择。

基准测试与准确率

Kev-9B 是性能最强的模型,在测试集上达到 0.852 的准确率。尽管在新源开发集上比托管的 Jev 模型低 3.5 个百分点(0.822 vs 0.857),但其在未见政策规则类型上的泛化能力表现出色。

模型 基础模型 准确率(新源 - 测试集) Brier 得分(新源 - 测试集)
Kev-0.8B Qwen3.5-0.8B 0.684 0.460
Kev-4B Qwen3.5-4B 0.837 0.255
Kev-9B Qwen3.5-9B 0.852 0.237

服务性能

延迟因硬件而异。在 CUDA(H100)上,五问请求耗时数十毫秒。在 Apple Silicon 上,由于 DeltaNet 层缺乏快速内核,9B 模型每请求约需 2 秒,而 4B 模型约为 779ms。对于 Mac 上的低延迟需求,建议使用前代基于 Qwen3 的模型。

API 与集成

Kev 的 API 与 TypeSafe 的 System One 保持一致,可无缝集成 TypeSafe 的 Python SDK。/v1/systemone 端点接受一个 state(待评估的文本)和一组 questions。

支持的问题类型

  • noul:二元是/否问题,返回“是”的概率。
  • choice:多选题,返回最可能的选项、所有选项的概率以及置信度分数。
  • score:评分题,返回平均等级索引、图例和概率。

训练与微调

Kev 使用交叉熵损失对正确答案进行训练,基础权重保持固定,仅训练适配器和指针头。

自定义微调

用户可使用 JSONL 格式在自有领域数据上对 Kev 进行微调。作者建议使用 --init_from 标志加载已发布检查点的适配器和指针头。这可保留模型的通用决策能力,同时注入领域知识。一项测试显示,从基础模型微调在 Kev 评估集上得分为 0.33,而从已发布检查点微调则保持 0.83 的准确率,并在新领域达到 0.88。

限制与注意事项

  • 校准:新源上的原始概率可能过于自信。使用 KEV_TEMPERATURE=2.0 可将 Kev-9B 的高置信错误率(概率 ≥ 0.9 的错误答案)从 8.7% 降至 4.4%。
  • 日期计算:模型在原始日期减法上表现不佳。设置 KEV_DATE_FACTS=1 会在绝对日期之间附加天数,使 Kev-9B 在截止日期政策问题上的准确率从 0.80 提升至 0.90。
  • 选项顺序:即使在问题隔离下,单个问题中选项顺序的改变仍可能影响答案。
  • 知识差距:与 Jev 相比,其在通用知识(MMLU)方面存在显著差距,这归因于基础模型的局限性。

社区洞察

开发者讨论表明,类似 Jev 的模型在内部路由逻辑、数据标注以及减少代理工作流中的工具调用开销方面尤为有用。一位用户指出,他们使用代理将提示路由至 Jev,以在发送至前沿模型前缩小工具范围,从而减少了 60% 的工具调用。

然而,一些批评者认为,Jev 的核心价值在于其训练数据而非架构,因此开源衍生模型若无类似高质量数据集,可能难以达到原始托管模型的性能水平。

Sources

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • Dispatch