firelex/jeff
Millisecond decisions, any domain: a 0.8B open "System 1" model that picks between your options with calibrated probabilities. One base, swappable LoRA adapters, on your own hardware.
解决的问题
Jeff 提供一种方式,将极快的零样本分类集成到本地代码中。它通过返回以纯文本描述的一组选项的校准概率,取代对大型、缓慢的 LLM 或复杂的生成文本解析的需求。这让开发者可以将一个小巧、高性能的决策模型嵌入应用程序中,用于意图分类、审核标签或语音命令等任务,而无需依赖云 API。
运作方式
Jeff 由一系列小巧、微调过的 Qwen3.5 和 Gemma 4 版本组成(参数量从 0.8B 到 2B)。与传统生成文本的 LLM 不同,Jeff 执行单次前向传递,为每个提供的选项返回一个概率。它使用训练好的答案读出层和拟合温度来进行校准。模型是在本地教师模型(Qwen3.8-Flash-Next)生成的合成数据上训练,并包含泄漏过滤器以确保基准测试的完整性。
适用对象
需要低延迟、本地决策代理的开发者,该代理能处理任意类别(零样本),并可针对特定领域任务进行微调以进一步提升准确度。
亮点
- 极速:在 RTX PRO 6000 上仅需 22 毫秒,在 Apple M4 Max 上仅需 28 毫秒即可做出决策。
- 零样本能力:可通过纯文本描述来分类训练数据中未出现的类别。
- 本地优先:完全在本地硬件上构建和训练,不依赖训练数据中的封闭模型输出。
- 可微调:支持对自定义示例进行快速微调,显著提升特定使用案例的准确度(例如,语音导航的准确度从 31.7% 提升至 95.8%)。
- 多问题支持:可在单个请求中回答多个独立问题。
- Apple Silicon 优化:包含 MLX 服务,可在 Mac 硬件上获得更好的性能。
相关
- 项目
- 项目
- 项目
- 项目