Jeff:兼容 Jev 的 0.8B 和 2B 零样本分类决策模型
Jeff 是一系列经过微调的小型开源权重语言模型,专为零样本分类而设计。通过利用单次前向传播返回一组选项的校准概率,而无需生成文本,Jeff 为传统的基于 LLM 的分类提供了一种高速替代方案。0.8B 参数模型在 NVIDIA RTX PRO 6000 上实现了约 22ms 的决策延迟,在 Apple M4 Max(通过 MLX)上实现了 28ms 的决策延迟。
高速决策
Jeff 的主要价值主张是极高的速度和成本效益。与在 token 上进行迭代的生成式 LLM 不同,Jeff 的功能类似于直接嵌入应用程序代码的分类器。
性能指标
| 模型 | 参数 | NVIDIA RTX PRO 6000 | Apple M4 Max (MLX) | CPU (32 线程) |
|---|---|---|---|---|
| Jeff-Qwen3.5-0.8B | 0.8B | 22 ms | 28 ms | 463 ms |
| Jeff-Qwen3.5-2B | 2B | 24 ms | 60 ms | 708 ms |
| Jeff-Gemma4-E2B | 2B 有效参数 | 29 ms | N/A | 1.0 s |
这些速度允许进行实时决策循环,例如语音导航或游戏 AI,而传统的基于 API 的模型(如 Jev)可能会引入过高的延迟(例如每次调用 114–212 ms)。
零样本分类与基准测试
Jeff 专为零样本任务而设计,用户可以在其中用简单的语言描述情况和选项列表。然后,模型根据描述选择最可能的选项。
基准测试结果
在五个公共基准测试中,Jeff-Qwen3.5-2B 模型实现了 83.1% 的总体准确率,与 Jev 公布的数据(83.0%)持平。虽然 Jeff 在分类和基础任务中表现出色——在 Financial PhraseBank (96.3% vs 77.0%) 和 RAGTruth (88.9% vs 77.3%) 上优于 Jev——但在推理密集型基准测试中表现滞后:
- BBH: 64-68% (Jeff) vs 94.3% (Jev)
- JudgeBench: 60-64% (Jeff) vs 78.6% (Jev)
- JevBench Hard: 47-53% (Jeff) vs 73.3% (Jev)
考虑到模型规模较小(0.8B 到 2B 参数),这种性能差距在预期之内,因为它们旨在作为“系统 1”判断调用者,而不是多步推理者。
本地训练与实现
Jeff 完全在本地硬件上构建,利用了一台 RTX PRO 6000 工作站 GPU。训练过程包括对一个 epoch 进行全权重微调,批次大小为 256,并对选项字母进行交叉熵计算。
- 合成数据: 训练数据由 Qwen3.8-Flash-Next 在两台 DGX Sparks 上生成,闭源模型仅用于质量抽查。
- 训练时间: 0.8B 模型训练大约需要 2 小时,2B 模型需要 3.5 小时。
- 微调: 对于特定领域的任务,短时间的微调可以显著提高准确性。在一个示例中,语音导航任务在单块 GPU 上不到 30 分钟内准确率从 31.7% 提升到了 95.8%。
实际应用:游戏测试
为了测试非基准数据上的零样本能力,Jeff 被用于玩三款游戏:Doom、Frogger 和 Pac-Man。
- Doom: Jeff-0.8B 每集实现了 6.55 次击杀,与硬编码规则机器人和 Jev 的发布运行表现相当。
- Frogger: Jeff-0.8B 实现了 10.3 次过关,显著优于未经训练的基础模型 (1.0)。
- Pac-Man: Jeff-0.8B 收集了 57 个颗粒,约为规则机器人性能的 60%。
使用指南与注意事项
为了最大限度地发挥 Jeff 的效能,开发者应遵循以下指南:
- 在代码中推理,用 Jeff 决策: 将 Jeff 用作分类器,而不是规划器。提供移动的后果(例如“此举会导致你被车撞”),而不是要求它预测未来状态。
- 措辞很重要: 选项的一致且描述性的措辞至关重要。描述目标方式的微小变化可能会导致性能的显著提升。
- 选项键: 使用短键(例如
{"1": "Refund request"})以最大限度地减少延迟和 token 开销。
社区反馈
虽然该项目因其本地优先的方法和速度而受到赞誉,但一些用户指出,零样本准确率会根据用例的不同而产生巨大差异。一位用户报告称,在他们的特定应用中,与 Jev 相比,准确率存在显著差距(70% vs 94%),这凸显了针对专门任务进行微调的重要性。
项目历史与许可
Jeff 是 AutoJev 的一个分支,AutoJev 是一个用于微调模型以返回 Jev 风格决策的开源配方。权重在 Apache 2.0 许可下发布,代码在 MIT 许可下发布。
Sources
相关
- Dispatch
- 项目
- Dispatch
- Dispatch
- Dispatch