Paritok-official/paritok-4b-v1
Non-destructive compression gateway for AI coding agents. Cuts token bills 25% on turn 1 to past 85% in long or saturated sessions, and fits ~3× more turns in the same context window. Powered by our open-source code-native 4B model. Drop-in for Claude Code, Cursor, Codex, OpenHands, and any BASE_URL agent.
Paritok — 코드 에이전트를 위한 토큰 절약 프록시
무엇인가요 – Paritok은 코드 어시스턴트(Claude Code, Cursor, Codex, OpenHands 등)와 하위 LLM API 사이에 위치하는 오픈소스로 즉시 사용 가능한 프록시입니다. 각 요청을 재작성하여 토큰 사용량의 세 가지 주요 원인을 줄입니다:
- 도구 스키마 필터 – 현재 사용자 의도와 실제로 관련된 도구만 유지하고, 나머지는 가벼운 스텁으로 대체합니다.
- 콘텐츠 압축 – 45K개의 실제 에이전트 트래잭션으로 훈련된 4B 파라미터 모델을 사용해 파일 읽기, 도구 출력, 오래된 기록을 원래 크기의 약 26%로 압축하고
[REF:id]플레이스홀더로 태그합니다. - 기록 요약 – 대화가 모델의 컨텍스트 창을 초과하면 오래된 대화를 요약하여 세션을 창 내에 유지합니다.
모든 압축은 비파괴적입니다: 에이전트는 언제든지 원본 텍스트를 요청할 수 있습니다(read_original/expand_context). 에이전트 코드 변경이 필요 없으며, 단지 에이전트의 BASE_URL (예: ANTHROPIC_BASE_URL 또는 OPENAI_BASE_URL)를 Paritok 서버로 지정하면 됩니다.
주요 구성 요소
| 구성 요소 | 기능 | 배포 방식 |
|---|---|---|
| Paritok 게이트웨이 | HTTP 미들웨어로 요청을 재작성하고 실제 LLM에 전달하며, 필요 시 압축된 참조를 확장합니다. | Python 패키지(paritok[proxy]), paritok up / paritok proxy로 실행 가능 |
| 4B 압축 모델 | 식별자, 경로, 오류 메시지 등을 유지하면서 주변 노이즈를 제거하는 학습을 합니다. | Hugging Face(paritok/paritok-4b-v1)에서 배포되며 Ollama(GGUF) 또는 vLLM에서 사용 가능 |
| 임베딩 기반 도구 필터 | 작고 CPU 전용 임베딩 모델(BAAI/bge-small-en-v1.5)을 사용해 도구 스키마를 순위 매기고 관련된 것만 유지합니다. |
paritok[toolselect]와 함께 설치 |
| 대시보드 / VS Code 확장 | 각 요청에 대한 토큰 절약량 실시간 확인 및 기능 전환용 UI. | 별도 리포지토리(paritok-vscode)와 /stats 엔드포인트 |
보고된 절약 효과
- 단일 타ーン: 입력 토큰 약 25% 감소 (일반적인 Claude Code 타ーン은 약 96K에서 약 72K로 감소).
- 다중 타ーン: 절약 효과가 누적됨. 타ーン 5에서는 약 39%, 타ーン 10에서는 약 54%, 200K 컨텍스트 예산에서는 약 72% 의 한계에 도달 가능.
- 비용 영향: Claude Sonnet($3 / M 입력 토큰) 기준 20타ーン 세션은 $0.75에서 $0.28로 감소.
빠른 시작 (자체 호스팅, 복제 필요 없음)
# 프록시 설치 (게이트웨이와 CLI 포함)
pip install "paritok[proxy]"
# Ollama를 통해 모델 가져오기 (처음 실행 시 약 2.5GB)
paritok up # `paritok-4b-v1`을 다운로드하고 포트 8080에서 프록시 시작
이 터미널을 실행한 상태로, 별도의 쉘에서 에이전트를 프록시에 연결합니다:
export ANTHROPIC_BASE_URL=http://127.0.0.1:8080 # Claude Code / Cursor / …
# 일반적인 프로바이더 API 키(예: ANTHROPIC_API_KEY)는 그대로 유지
에이전트는 변경 없이 작동하며, Paritok은 요청을 전달하기 전에 조용히 압축합니다.
배포 옵션
| 옵션 | 필요 하드웨어 | 실행 방법 |
|---|---|---|
| 자체 호스팅(기본) | 작은 임베딩 모델용 CPU; 4B 모델용 GPU(옵션, Ollama 또는 vLLM 사용). | paritok up(Ollama) 또는 vllm serve … + paritok proxy |
| 호스팅 GPU 서비스 | 필요 없음 – SaaS 엔드포인트 paritok.com 사용. |
paritok.yaml에서 use_gpu_server: true 설정하고 API 키 제공 |
둘 다 Apache-2.0 라이선스이며, 로컬에서 무료로 실행 가능합니다.
누가 이득을 볼 수 있나요?
- 대규모 파일을 반복적으로 읽거나 많은 도구를 호출하는 코드 에이전트를 사용하는 개발자 (예: 디버깅, 코드베이스 감사).
- 긴 다중 타ーン 세션을 수행하는 팀 – 토큰 절약은 클라우드 LLM 비용 절감과 컨텍스트 제한에 도달하기 전까지의 타ーン 수 증가로 직결됩니다.
- 에이전트 코드를 수정하지 않고 즉시 사용 가능한 토큰 감소 레이어를 원하는 누구나.
README에서의 링크
- 논문 – arXiv: 2608.24188
- 모델 – Hugging Face Hub
paritok/paritok-4b-v1 - Discord 커뮤니티 – https://discord.gg/SeBJE5Eucp
- VS Code 확장 – https://github.com/Paritok-official/paritok-vscode
결론: Paritok은 진정한 오픈소스 도구로, 동일한 LLM을 유지하면서 선택적 도구 필터링, 모델 기반 압축, 스마트 요약을 통해 입력 토큰 비용을 극적으로 줄일 수 있게 해줍니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch