Paritok-official/paritok-4b-v1
Non-destructive compression gateway for AI coding agents. Cuts token bills 25% on turn 1 to past 85% in long or saturated sessions, and fits ~3× more turns in the same context window. Powered by our open-source code-native 4B model. Drop-in for Claude Code, Cursor, Codex, OpenHands, and any BASE_URL agent.
Paritok — 用于代码代理的 token 节省型代理
是什么 – Paritok 是一个开源、即插即用的代理,位于代码助手(Claude Code、Cursor、Codex、OpenHands 等)与底层 LLM API 之间。它重写每个请求,以缩小三大主要 token 使用来源:
- 工具模式过滤 – 仅保留与当前用户意图真正相关的工具,其余工具替换为轻量级桩函数。
- 内容压缩 – 运行一个 4B 参数模型(在 45K 个真实代理轨迹上训练),将文件读取、工具输出和过时历史压缩至原始大小的约 26%,并用
[REF:id]占位符标记。 - 历史摘要 – 当对话超过模型的上下文窗口时,对旧轮次进行摘要,使会话保持在窗口内。
所有压缩均为 非破坏性:代理可随时请求原始文本(read_original / expand_context)。代理无需任何代码更改——只需将代理的 BASE_URL(如 ANTHROPIC_BASE_URL 或 OPENAI_BASE_URL)指向 Paritok 服务器即可。
主要组件
| 组件 | 功能 | 分发方式 |
|---|---|---|
| Paritok 网关 | HTTP 中间件,重写请求,转发至真实 LLM,并按需展开压缩引用。 | Python 包(paritok[proxy]),可通过 paritok up / paritok proxy 运行 |
| 4B 压缩模型 | 学习保留标识符、路径、错误消息等,同时丢弃周围噪声。 | 在 Hugging Face 上分发(paritok/paritok-4b-v1),可通过 Ollama(GGUF)或 vLLM 使用 |
| 基于嵌入的工具过滤器 | 使用小型 CPU 专用嵌入模型(BAAI/bge-small-en-v1.5)对工具模式进行排序,仅保留相关项。 |
通过 paritok[toolselect] 安装 |
| 仪表板 / VS Code 扩展 | 实时查看每请求的 token 节省情况,并提供功能切换的 UI。 | 独立仓库(paritok-vscode)和 /stats 端点 |
报告的节省效果
- 单轮次:输入 token 减少约 25%(典型 Claude Code 轮次从约 96K 降至约 72K token)。
- 多轮次:节省效果累加——第 5 轮减少约 39%,第 10 轮约 54%,在 200K 上下文预算下可达到 约 72% 的上限。
- 成本影响:在 Claude Sonnet($3 / M 输入 token)下,20 轮会话从 $0.75 降至 $0.28。
快速启动(自托管,无需克隆)
# 安装代理(包含网关和 CLI)
pip install "paritok[proxy]"
# 通过 Ollama 拉取模型(仅首次运行约 2.5GB)
paritok up # 拉取 `paritok-4b-v1` 并在端口 8080 启动代理
保持该终端运行,然后在 另一个 终端中将你的代理指向代理服务器:
export ANTHROPIC_BASE_URL=http://127.0.0.1:8080 # Claude Code / Cursor / …
# 保持正常提供方 API 密钥(如 ANTHROPIC_API_KEY)不变
代理无需更改;Paritok 会在转发前静默压缩请求。
部署选项
| 选项 | 所需硬件 | 如何运行 |
|---|---|---|
| 自托管(默认) | CPU 用于小型嵌入模型;GPU 可选用于 4B 模型(通过 Ollama 或 vLLM)。 | paritok up(Ollama)或 vllm serve … + paritok proxy |
| 托管 GPU 服务 | 无需 – 使用 SaaS 端点 paritok.com。 |
在 paritok.yaml 中设置 use_gpu_server: true 并提供 API 密钥。 |
两者均采用 Apache-2.0 许可证,可在本地免费运行。
哪些人可能受益?
- 反复读取大文件或调用大量工具的代码代理使用者(如调试、代码库审计)。
- 长时间、多轮次会话的团队 – token 节省直接转化为更低的云 LLM 费用和更少的上下文限制突破。
- 希望无需修改代理代码即可即插即用 token 减少层的任何人。
README 中的链接
- 论文 – arXiv: 2608.24188
- 模型 – Hugging Face Hub
paritok/paritok-4b-v1 - Discord 社区 – https://discord.gg/SeBJE5Eucp
- VS Code 扩展 – https://github.com/Paritok-official/paritok-vscode
总结:Paritok 是一个真正的开源工具,让代码代理用户在保持相同 LLM 的同时,通过选择性工具过滤、基于模型的压缩和智能摘要,大幅削减输入 token 成本。
相关
- 项目
- 项目
- 项目
- Dispatch