Paritok-official/paritok-4b-v1

Non-destructive compression gateway for AI coding agents. Cuts token bills 25% on turn 1 to past 85% in long or saturated sessions, and fits ~3× more turns in the same context window. Powered by our open-source code-native 4B model. Drop-in for Claude Code, Cursor, Codex, OpenHands, and any BASE_URL agent.

Paritok — 코드 에이전트를 위한 토큰 절약 프록시

무엇인가요 – Paritok은 코드 어시스턴트(Claude Code, Cursor, Codex, OpenHands 등)와 하위 LLM API 사이에 위치하는 오픈소스로 즉시 사용 가능한 프록시입니다. 각 요청을 재작성하여 토큰 사용량의 세 가지 주요 원인을 줄입니다:

  1. 도구 스키마 필터 – 현재 사용자 의도와 실제로 관련된 도구만 유지하고, 나머지는 가벼운 스텁으로 대체합니다.
  2. 콘텐츠 압축 – 45K개의 실제 에이전트 트래잭션으로 훈련된 4B 파라미터 모델을 사용해 파일 읽기, 도구 출력, 오래된 기록을 원래 크기의 약 26%로 압축하고 [REF:id] 플레이스홀더로 태그합니다.
  3. 기록 요약 – 대화가 모델의 컨텍스트 창을 초과하면 오래된 대화를 요약하여 세션을 창 내에 유지합니다.

모든 압축은 비파괴적입니다: 에이전트는 언제든지 원본 텍스트를 요청할 수 있습니다(read_original/expand_context). 에이전트 코드 변경이 필요 없으며, 단지 에이전트의 BASE_URL (예: ANTHROPIC_BASE_URL 또는 OPENAI_BASE_URL)를 Paritok 서버로 지정하면 됩니다.


주요 구성 요소

구성 요소 기능 배포 방식
Paritok 게이트웨이 HTTP 미들웨어로 요청을 재작성하고 실제 LLM에 전달하며, 필요 시 압축된 참조를 확장합니다. Python 패키지(paritok[proxy]), paritok up / paritok proxy로 실행 가능
4B 압축 모델 식별자, 경로, 오류 메시지 등을 유지하면서 주변 노이즈를 제거하는 학습을 합니다. Hugging Face(paritok/paritok-4b-v1)에서 배포되며 Ollama(GGUF) 또는 vLLM에서 사용 가능
임베딩 기반 도구 필터 작고 CPU 전용 임베딩 모델(BAAI/bge-small-en-v1.5)을 사용해 도구 스키마를 순위 매기고 관련된 것만 유지합니다. paritok[toolselect]와 함께 설치
대시보드 / VS Code 확장 각 요청에 대한 토큰 절약량 실시간 확인 및 기능 전환용 UI. 별도 리포지토리(paritok-vscode)와 /stats 엔드포인트

보고된 절약 효과

  • 단일 타ーン: 입력 토큰 약 25% 감소 (일반적인 Claude Code 타ーン은 약 96K에서 약 72K로 감소).
  • 다중 타ーン: 절약 효과가 누적됨. 타ーン 5에서는 약 39%, 타ーン 10에서는 약 54%, 200K 컨텍스트 예산에서는 약 72% 의 한계에 도달 가능.
  • 비용 영향: Claude Sonnet($3 / M 입력 토큰) 기준 20타ーン 세션은 $0.75에서 $0.28로 감소.

빠른 시작 (자체 호스팅, 복제 필요 없음)

# 프록시 설치 (게이트웨이와 CLI 포함)
pip install "paritok[proxy]"

# Ollama를 통해 모델 가져오기 (처음 실행 시 약 2.5GB)
paritok up          # `paritok-4b-v1`을 다운로드하고 포트 8080에서 프록시 시작

이 터미널을 실행한 상태로, 별도의 쉘에서 에이전트를 프록시에 연결합니다:

export ANTHROPIC_BASE_URL=http://127.0.0.1:8080   # Claude Code / Cursor / …
# 일반적인 프로바이더 API 키(예: ANTHROPIC_API_KEY)는 그대로 유지

에이전트는 변경 없이 작동하며, Paritok은 요청을 전달하기 전에 조용히 압축합니다.


배포 옵션

옵션 필요 하드웨어 실행 방법
자체 호스팅(기본) 작은 임베딩 모델용 CPU; 4B 모델용 GPU(옵션, Ollama 또는 vLLM 사용). paritok up(Ollama) 또는 vllm serve … + paritok proxy
호스팅 GPU 서비스 필요 없음 – SaaS 엔드포인트 paritok.com 사용. paritok.yaml에서 use_gpu_server: true 설정하고 API 키 제공

둘 다 Apache-2.0 라이선스이며, 로컬에서 무료로 실행 가능합니다.


누가 이득을 볼 수 있나요?

  • 대규모 파일을 반복적으로 읽거나 많은 도구를 호출하는 코드 에이전트를 사용하는 개발자 (예: 디버깅, 코드베이스 감사).
  • 긴 다중 타ーン 세션을 수행하는 팀 – 토큰 절약은 클라우드 LLM 비용 절감과 컨텍스트 제한에 도달하기 전까지의 타ーン 수 증가로 직결됩니다.
  • 에이전트 코드를 수정하지 않고 즉시 사용 가능한 토큰 감소 레이어를 원하는 누구나.

README에서의 링크


결론: Paritok은 진정한 오픈소스 도구로, 동일한 LLM을 유지하면서 선택적 도구 필터링, 모델 기반 압축, 스마트 요약을 통해 입력 토큰 비용을 극적으로 줄일 수 있게 해줍니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch