firelex/jeff

Millisecond decisions, any domain: a 0.8B open "System 1" model that picks between your options with calibrated probabilities. One base, swappable LoRA adapters, on your own hardware.

解決的問題

Jeff 提供一種方式,將極快的零樣本分類整合到本地端程式碼中。它透過回傳以純文字描述的一組選項的校準機率,取代對大型、緩慢的 LLM 或複雜的生成文字解析的需求。這讓開發者可以將一個小巧、高效能的決策模型嵌入應用程式中,用於意圖分類、審核標籤或語音指令等任務,而無需依賴雲端 API。

運作方式

Jeff 由一系列小巧、微調過的 Qwen3.5 和 Gemma 4 版本組成(參數量從 0.8B 到 2B)。與傳統生成文字的 LLM 不同,Jeff 執行單次前向傳遞,為每個提供的選項回傳一個機率。它使用訓練好的答案讀出層和擬合溫度來進行校準。模型是在本地教師模型(Qwen3.8-Flash-Next)生成的合成資料上訓練,並包含洩漏過濾器以確保基準測試的完整性。

適用對象

需要低延遲、本地端決策代理的開發者,該代理能處理任意類別(零樣本),並可針對特定領域任務進行微調以進一步提升準確度。

亮點

  • 極速:在 RTX PRO 6000 上僅需 22 毫秒,在 Apple M4 Max 上僅需 28 毫秒即可做出決策。
  • 零樣本能力:可透過純文字描述來分類訓練資料中未出現的類別。
  • 本地優先:完全在本地硬體上建置和訓練,不依賴訓練資料中的封閉模型輸出。
  • 可微調:支援對自訂範例進行快速微調,顯著提升特定使用案例的準確度(例如,語音導航的準確度從 31.7% 提升至 95.8%)。
  • 多問題支援:可在單一請求中回答多個獨立問題。
  • Apple Silicon 最佳化:包含 MLX 服務,可在 Mac 硬體上獲得更好的效能。

相關

  • 專案
  • 專案
  • 專案
  • 專案