Paritok-official/paritok-4b-v1
Non-destructive compression gateway for AI coding agents. Cuts token bills 25% on turn 1 to past 85% in long or saturated sessions, and fits ~3× more turns in the same context window. Powered by our open-source code-native 4B model. Drop-in for Claude Code, Cursor, Codex, OpenHands, and any BASE_URL agent.
Paritok — 為程式代理設計的 token 節省型代理
是什麼 – Paritok 是一個開源、即插即用的代理,位於程式助手(Claude Code、Cursor、Codex、OpenHands 等)與底層 LLM API 之間。它重寫每個請求,以縮小三大主要 token 使用來源:
- 工具模式過濾 – 僅保留與當前使用者意圖真正相關的工具,其餘工具以輕量級樁函數取代。
- 內容壓縮 – 執行一個 4B 參數模型(在 45K 個真實代理軌跡上訓練),將檔案讀取、工具輸出與過時歷史壓縮至原始大小的約 26%,並以
[REF:id]占位符標記。 - 歷史摘要 – 當對話超過模型的上下文視窗時,對舊回合進行摘要,使會話保持在視窗內。
所有壓縮均為 非破壞性:代理可隨時請求原始文字(read_original / expand_context)。代理無需任何程式碼變更——只需將代理的 BASE_URL(如 ANTHROPIC_BASE_URL 或 OPENAI_BASE_URL)指向 Paritok 伺服器即可。
主要元件
| 元件 | 功能 | 分發方式 |
|---|---|---|
| Paritok 網關 | HTTP 中間件,重寫請求,轉發至真實 LLM,並按需展開壓縮引用。 | Python 套件(paritok[proxy]),可透過 paritok up / paritok proxy 執行 |
| 4B 壓縮模型 | 學習保留識別碼、路徑、錯誤訊息等,同時捨棄周圍雜訊。 | 在 Hugging Face 上分發(paritok/paritok-4b-v1),可透過 Ollama(GGUF)或 vLLM 使用 |
| 基於嵌入的工具過濾器 | 使用小型 CPU 專用嵌入模型(BAAI/bge-small-en-v1.5)對工具模式排序,僅保留相關項目。 |
透過 paritok[toolselect] 安裝 |
| 儀表板 / VS Code 擴充 | 實時查看每請求的 token 節省情況,並提供功能切換的 UI。 | 獨立倉儲(paritok-vscode)和 /stats 端點 |
報告的節省效果
- 單回合:輸入 token 減少約 25%(典型 Claude Code 回合從約 96K 降至約 72K token)。
- 多回合:節省效果累加——第 5 回合減少約 39%,第 10 回合約 54%,在 200K 上下文預算下可達 約 72% 的上限。
- 成本影響:在 Claude Sonnet($3 / M 輸入 token)下,20 回合會話從 $0.75 降至 $0.28。
快速啟動(自托管,無需克隆)
# 安裝代理(包含網關和 CLI)
pip install "paritok[proxy]"
# 透過 Ollama 拉取模型(僅首次執行約 2.5GB)
paritok up # 拉取 `paritok-4b-v1` 並在埠 8080 啟動代理
保持該終端執行,然後在 另一個 終端中將你的代理指向代理伺服器:
export ANTHROPIC_BASE_URL=http://127.0.0.1:8080 # Claude Code / Cursor / …
# 保持正常提供方 API 金鑰(如 ANTHROPIC_API_KEY)不變
代理無需變更;Paritok 會在轉發前靜默壓縮請求。
部署選項
| 選項 | 所需硬體 | 如何執行 |
|---|---|---|
| 自托管(預設) | CPU 用於小型嵌入模型;GPU 可選用於 4B 模型(透過 Ollama 或 vLLM)。 | paritok up(Ollama)或 vllm serve … + paritok proxy |
| 託管 GPU 服務 | 無需 – 使用 SaaS 端點 paritok.com。 |
在 paritok.yaml 中設定 use_gpu_server: true 並提供 API 金鑰。 |
兩者均採用 Apache-2.0 許可證,可在本地免費執行。
哪些人可能受惠?
- 反覆讀取大檔案或呼叫大量工具的程式代理使用者(如除錯、程式碼庫審計)。
- 長時間、多回合會話的團隊 – token 節省直接轉化為更低的雲端 LLM 費用與更少的上下文限制突破。
- 希望無需修改代理程式碼即可即插即用 token 減少層的任何人。
README 中的連結
- 論文 – arXiv: 2608.24188
- 模型 – Hugging Face Hub
paritok/paritok-4b-v1 - Discord 社群 – https://discord.gg/SeBJE5Eucp
- VS Code 擴充 – https://github.com/Paritok-official/paritok-vscode
總結:Paritok 是一個真正的開源工具,讓程式代理使用者在維持相同 LLM 的同時,透過選擇性工具過濾、基於模型的壓縮與智慧摘要,大幅削減輸入 token 成本。
相關
- 專案
- 專案
- 專案
- Dispatch