firelex/jeff
Millisecond decisions, any domain: a 0.8B open "System 1" model that picks between your options with calibrated probabilities. One base, swappable LoRA adapters, on your own hardware.
解決する課題
Jeffは、極めて高速なゼロショット分類をローカルコードに統合する方法を提供します。平易な言葉で記述された一連のオプションに対して校正された確率を返すことで、大規模で低速なLLMや生成テキストの複雑な解析の必要性を排除します。これにより、開発者は意図分類、モデレーションラベル、音声コマンドなどのタスクのために、クラウドAPIを必要とせずに、小型で高性能な決定モデルをアプリケーションに組み込むことができます。
仕組み
Jeffは、Qwen3.5およびGemma 4の小型でファインチューニングされたバージョン(パラメータ数0.8B〜2B)で構成されています。テキストを生成する従来のLLMとは異なり、Jeffは単一のフォワードパスを実行して、提供された各オプションの確率を返します。トレーニング済みの回答読み出し層と、校正用にフィッティングされた温度を使用します。モデルは、ローカルの教師モデル(Qwen3.8-Flash-Next)によって生成された合成データでトレーニングされ、ベンチマークの整合性を確保するためのリークフィルターが含まれています。
対象読者
任意のカテゴリ(ゼロショット)を処理でき、特定のドメイン固有タスク向けにファインチューニングして精度をさらに向上できる、低遅延でローカルな意思決定エージェントを必要とする開発者。
ハイライト
- 超高速:RTX PRO 6000でわずか22ms、Apple M4 Maxで28msで意思決定を行います。
- ゼロショット機能:平易な言葉で記述することで、トレーニングデータに存在しないカテゴリを分類できます。
- ローカルファースト:トレーニングデータにクローズドモデルの出力を依存せず、完全にローカルハードウェア上で構築・トレーニングされています。
- ファインチューニング可能:カスタム例での迅速なファインチューニングをサポートし、特定のユースケースの精度を大幅に向上させます(例:音声ナビゲーションで31.7%から95.8%へ)。
- 複数質問対応:単一のリクエストで複数の独立した質問に回答できます。
- Apple Silicon最適化:Macハードウェアでの高速パフォーマンスのためのMLXサービスを含みます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト