TheoLeeCJ/SemIf

Semantic ifs from open models, on a 3090 at home. Independent; not affiliated with Jev or TypeSafe.

해결하는 문제

SemIf는 AI 에이전트가 요청 라우팅이나 작업 재시도와 같은 작은 타입된 결정을 수행할 때, 전체 텍스트 응답 생성의 오버헤드를 피할 수 있도록 더 빠르고 효율적인 방법을 제공합니다. 모델에게 "예" 또는 "아니오"를 생성하게 하고 그 텍스트를 파싱하는 대신 SemIf는 모델의 내부 상태(logits)에서 특정 옵션의 확률을 직접 읽어내어, 디코딩 루프나 JSON 수리의 필요성을 제거합니다.

작동 방식

SemIf는 "결정 중심" 접근 방식을 사용하며, 조건과 옵션을 단일 요청으로 모델에 제공합니다. 시스템은 토큰 샘플링 대신 네이티브 옵션 logits을 읽어 제공된 옵션에 대한 확률을 결정합니다. 또한 "공유 상태 인식"을 지원하여, 한 번만 장기 컨텍스트(상태)를 사전 로드한 후 병렬로 여러 다른 결정 기준에 분기할 수 있어 처리량을 크게 증가시킵니다.

대상 사용자

비구조화된 상태를 기반으로 고속의 구조화된 결정이 필요한 AI 에이전트를 개발하는 개발자들, 그리고 Qwen이나 MiniCPM과 같은 오픈소스 모델을 소비자 수준의 하드웨어(예: RTX 3090)에서 사용하여 의미적 결정 패턴을 구현하고자 하는 개발자들.

주요 특징

  • 직접적인 logits 읽기: 토큰 생성을 완전히 회피하여, 자기회귀적 JSON 생성보다 결정 시간이 크게 단축됩니다.
  • 공유 상태 재사용: 상태를 한 번만 사전 로드하여 병렬로 여러 기준을 평가할 수 있어, 초당 결정 수를 극대화합니다.
  • 브라우저 기반 실행: WebGPU 데모를 포함하여 사용자가 브라우저에서 모델을 직접 실행할 수 있습니다.
  • 검증 가능한 벤치마크: Jev와 같은 폐쇄형 서비스와의 성능 및 정확도 비교를 위한 포괄적인 결과 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트