firelex/jeff

Millisecond decisions, any domain: a 0.8B open "System 1" model that picks between your options with calibrated probabilities. One base, swappable LoRA adapters, on your own hardware.

해결하는 문제

Jeff는 극도로 빠른 제로샷 분류를 로컬 코드에 통합하는 방법을 제공합니다. 일반 언어로 설명된 옵션 집합에 대해 보정된 확률을 반환함으로써, 크고 느린 LLM이나 생성된 텍스트의 복잡한 파싱의 필요성을 대체합니다. 이를 통해 개발자는 의도 분류, 중재 라벨, 음성 명령과 같은 작업을 위해 클라우드 API 없이도 작고 고성능인 결정 모델을 애플리케이션에 통합할 수 있습니다.

작동 방식

Jeff는 Qwen3.5 및 Gemma 4의 작고 파인튜닝된 버전(0.8B~2B 파라미터)으로 구성됩니다. 텍스트를 생성하는 기존 LLM과 달리, Jeff는 단일 순방향 패스를 수행하여 제공된 각 옵션에 대한 확률을 반환합니다. 훈련된 답변 판독 레이어와 보정을 위해 피팅된 온도를 사용합니다. 모델은 로컬 교사 모델(Qwen3.8-Flash-Next)이 생성한 합성 데이터로 훈련되며, 벤치마크 무결성을 보장하기 위한 누출 필터가 포함됩니다.

대상 사용자

임의의 카테고리(제로샷)를 처리할 수 있고, 특정 도메인별 작업에 대해 파인튜닝하여 정확도를 더욱 높일 수 있는 저지연 로컬 결정 에이전트가 필요한 개발자.

주요 특징

  • 극한 속도: RTX PRO 6000에서 22ms, Apple M4 Max에서 28ms만에 결정을 내립니다.
  • 제로샷 기능: 일반 언어로 설명하여 훈련 데이터에 없는 카테고리를 분류할 수 있습니다.
  • 로컬 우선: 폐쇄형 모델 출력에 의존하지 않고 완전히 로컬 하드웨어에서 구축 및 훈련되었습니다.
  • 파인튜닝 가능: 사용자 정의 예제에 대한 빠른 파인튜닝을 지원하여 특정 사용 사례의 정확도를 크게 향상시킵니다(예: 음성 내비게이션에서 31.7%에서 95.8%로).
  • 다중 질문 지원: 단일 요청에서 여러 독립적인 질문에 답할 수 있습니다.
  • Apple Silicon 최적화: Mac 하드웨어에서 더 빠른 성능을 위한 MLX 서빙을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트