firelex/jeff

Millisecond decisions, any domain: a 0.8B open "System 1" model that picks between your options with calibrated probabilities. One base, swappable LoRA adapters, on your own hardware.

解决的问题

Jeff 提供一种方式,将极快的零样本分类集成到本地代码中。它通过返回以纯文本描述的一组选项的校准概率,取代对大型、缓慢的 LLM 或复杂的生成文本解析的需求。这让开发者可以将一个小巧、高性能的决策模型嵌入应用程序中,用于意图分类、审核标签或语音命令等任务,而无需依赖云 API。

运作方式

Jeff 由一系列小巧、微调过的 Qwen3.5 和 Gemma 4 版本组成(参数量从 0.8B 到 2B)。与传统生成文本的 LLM 不同,Jeff 执行单次前向传递,为每个提供的选项返回一个概率。它使用训练好的答案读出层和拟合温度来进行校准。模型是在本地教师模型(Qwen3.8-Flash-Next)生成的合成数据上训练,并包含泄漏过滤器以确保基准测试的完整性。

适用对象

需要低延迟、本地决策代理的开发者,该代理能处理任意类别(零样本),并可针对特定领域任务进行微调以进一步提升准确度。

亮点

  • 极速:在 RTX PRO 6000 上仅需 22 毫秒,在 Apple M4 Max 上仅需 28 毫秒即可做出决策。
  • 零样本能力:可通过纯文本描述来分类训练数据中未出现的类别。
  • 本地优先:完全在本地硬件上构建和训练,不依赖训练数据中的封闭模型输出。
  • 可微调:支持对自定义示例进行快速微调,显著提升特定使用案例的准确度(例如,语音导航的准确度从 31.7% 提升至 95.8%)。
  • 多问题支持:可在单个请求中回答多个独立问题。
  • Apple Silicon 优化:包含 MLX 服务,可在 Mac 硬件上获得更好的性能。

相关

  • 项目
  • 项目
  • 项目
  • 项目