Jeff:兼容 Jev 的 0.8B 和 2B 零样本分类决策模型

Jeff 是一系列经过微调的小型开源权重语言模型,专为零样本分类而设计。通过利用单次前向传播返回一组选项的校准概率,而无需生成文本,Jeff 为传统的基于 LLM 的分类提供了一种高速替代方案。0.8B 参数模型在 NVIDIA RTX PRO 6000 上实现了约 22ms 的决策延迟,在 Apple M4 Max(通过 MLX)上实现了 28ms 的决策延迟。

高速决策

Jeff 的主要价值主张是极高的速度和成本效益。与在 token 上进行迭代的生成式 LLM 不同,Jeff 的功能类似于直接嵌入应用程序代码的分类器。

性能指标

模型 参数 NVIDIA RTX PRO 6000 Apple M4 Max (MLX) CPU (32 线程)
Jeff-Qwen3.5-0.8B 0.8B 22 ms 28 ms 463 ms
Jeff-Qwen3.5-2B 2B 24 ms 60 ms 708 ms
Jeff-Gemma4-E2B 2B 有效参数 29 ms N/A 1.0 s

这些速度允许进行实时决策循环,例如语音导航或游戏 AI,而传统的基于 API 的模型(如 Jev)可能会引入过高的延迟(例如每次调用 114–212 ms)。

零样本分类与基准测试

Jeff 专为零样本任务而设计,用户可以在其中用简单的语言描述情况和选项列表。然后,模型根据描述选择最可能的选项。

基准测试结果

在五个公共基准测试中,Jeff-Qwen3.5-2B 模型实现了 83.1% 的总体准确率,与 Jev 公布的数据(83.0%)持平。虽然 Jeff 在分类和基础任务中表现出色——在 Financial PhraseBank (96.3% vs 77.0%) 和 RAGTruth (88.9% vs 77.3%) 上优于 Jev——但在推理密集型基准测试中表现滞后:

  • BBH: 64-68% (Jeff) vs 94.3% (Jev)
  • JudgeBench: 60-64% (Jeff) vs 78.6% (Jev)
  • JevBench Hard: 47-53% (Jeff) vs 73.3% (Jev)

考虑到模型规模较小(0.8B 到 2B 参数),这种性能差距在预期之内,因为它们旨在作为“系统 1”判断调用者,而不是多步推理者。

本地训练与实现

Jeff 完全在本地硬件上构建,利用了一台 RTX PRO 6000 工作站 GPU。训练过程包括对一个 epoch 进行全权重微调,批次大小为 256,并对选项字母进行交叉熵计算。

  • 合成数据: 训练数据由 Qwen3.8-Flash-Next 在两台 DGX Sparks 上生成,闭源模型仅用于质量抽查。
  • 训练时间: 0.8B 模型训练大约需要 2 小时,2B 模型需要 3.5 小时。
  • 微调: 对于特定领域的任务,短时间的微调可以显著提高准确性。在一个示例中,语音导航任务在单块 GPU 上不到 30 分钟内准确率从 31.7% 提升到了 95.8%。

实际应用:游戏测试

为了测试非基准数据上的零样本能力,Jeff 被用于玩三款游戏:Doom、Frogger 和 Pac-Man。

  • Doom: Jeff-0.8B 每集实现了 6.55 次击杀,与硬编码规则机器人和 Jev 的发布运行表现相当。
  • Frogger: Jeff-0.8B 实现了 10.3 次过关,显著优于未经训练的基础模型 (1.0)。
  • Pac-Man: Jeff-0.8B 收集了 57 个颗粒,约为规则机器人性能的 60%。

使用指南与注意事项

为了最大限度地发挥 Jeff 的效能,开发者应遵循以下指南:

  • 在代码中推理,用 Jeff 决策: 将 Jeff 用作分类器,而不是规划器。提供移动的后果(例如“此举会导致你被车撞”),而不是要求它预测未来状态。
  • 措辞很重要: 选项的一致且描述性的措辞至关重要。描述目标方式的微小变化可能会导致性能的显著提升。
  • 选项键: 使用短键(例如 {"1": "Refund request"})以最大限度地减少延迟和 token 开销。

社区反馈

虽然该项目因其本地优先的方法和速度而受到赞誉,但一些用户指出,零样本准确率会根据用例的不同而产生巨大差异。一位用户报告称,在他们的特定应用中,与 Jev 相比,准确率存在显著差距(70% vs 94%),这凸显了针对专门任务进行微调的重要性。

项目历史与许可

Jeff 是 AutoJev 的一个分支,AutoJev 是一个用于微调模型以返回 Jev 风格决策的开源配方。权重在 Apache 2.0 许可下发布,代码在 MIT 许可下发布。

Sources

相关