Paritok-official/paritok-4b-v1
Non-destructive compression gateway for AI coding agents. Cuts token bills 25% on turn 1 to past 85% in long or saturated sessions, and fits ~3× more turns in the same context window. Powered by our open-source code-native 4B model. Drop-in for Claude Code, Cursor, Codex, OpenHands, and any BASE_URL agent.
Paritok — コーディングエージェント向けのトークン節約プロキシ
何であるか – Paritok は、コーディングアシスタント(Claude Code、Cursor、Codex、OpenHands など)と下位の LLM API の間に配置されるオープンソースで即時導入可能なプロキシです。各リクエストを再書き換えし、トークン使用量の3つの主要な要因を削減します:
- ツールスキーマフィルタ – 現在のユーザーの意図に関連するツールのみを保持し、それ以外は軽量なスタブに置き換えます。
- コンテンツ圧縮 – 45K の実際のエージェントトラジェクトリで訓練された 4B パラメータモデルを使用して、ファイル読み取り、ツール出力、古くなった履歴を元のサイズの約26%に圧縮し、
[REF:id]プレースホルダーでタグ付けします。 - 履歴要約 – 会話がモデルのコンテキストウィンドウを超えると、古いトーンを要約してセッションがウィンドウ内に収まるようにします。
すべての圧縮は 非破壊的 です:エージェントはいつでも元のテキストを要求できます(read_original / expand_context)。エージェントのコード変更は一切不要です。エージェントの BASE_URL(例:ANTHROPIC_BASE_URL または OPENAI_BASE_URL)を Paritok サーバーに設定するだけです。
主要コンポーネント
| コンポーネント | 機能 | 配布方法 |
|---|---|---|
| Paritok ゲートウェイ | HTTPミドルウェアでリクエストを再書き換えし、実際の LLM に転送し、必要に応じて圧縮された参照を展開します。 | Pythonパッケージ(paritok[proxy])、paritok up / paritok proxy として実行可能 |
| 4B 圧縮モデル | アイデンティファイア、パス、エラーメッセージなどを保持しながら、周囲のノイズを削除する学習をします。 | Hugging Face(paritok/paritok-4b-v1)で配布され、Ollama(GGUF)または vLLM で利用可能 |
| 埋め込みベースのツールフィルタ | 小さな CPU専用埋め込みモデル(BAAI/bge-small-en-v1.5)を使用してツールスキーマをランク付けし、関連するもののみを保持します。 |
paritok[toolselect] と一緒にインストール |
| ダッシュボード / VS Code 拡張 | 各リクエストごとのトークン節約のライブ表示と、機能の切り替え用 UI。 | 別のリポジトリ(paritok-vscode)と /stats エンドポイント |
報告された節約効果
- 単一ターン:入力トークンが約25%削減(典型的な Claude Code ターンは約96K から約72K に減少)。
- 複数ターン:節約効果が累積。ターン5で約39%、ターン10で約54%、200K コンテキスト予算では 約72% の上限に達します。
- コストへの影響:Claude Sonnet($3 / M 入力トークン)の場合、20ターンのセッションは $0.75 から $0.28 に低下します。
クイックスタート(セルフホスト、クローン不要)
# プロキシのインストール(ゲートウェイとCLIを含む)
pip install "paritok[proxy]"
# Ollamaでモデルを取得(初回のみ約2.5GB)
paritok up # `paritok-4b-v1` を取得し、ポート8080でプロキシを起動
このターミナルを起動したままにして、別のシェルでエージェントをプロキシに接続します:
export ANTHROPIC_BASE_URL=http://127.0.0.1:8080 # Claude Code / Cursor / …
# 通常のプロバイダーアクセスキー(例:ANTHROPIC_API_KEY)をそのまま設定
エージェントは変更なしで動作します。Paritok はリクエストを転送する前に静かに圧縮します。
デプロイオプション
| オプション | 必要なハードウェア | 実行方法 |
|---|---|---|
| セルフホスト(デフォルト) | 小さな埋め込みモデル用にCPU;4Bモデル用にGPU(OllamaまたはvLLM経由でオプション)。 | paritok up(Ollama)または vllm serve … + paritok proxy |
| ホストGPUサービス | なし – SaaSエンドポイント paritok.com を使用。 |
paritok.yaml で use_gpu_server: true を設定し、APIキーを提供 |
両方とも Apache-2.0 ライセンスで、ローカルで無料で実行可能です。
誰が恩恵を受けるか?
- 大きなファイルを繰り返し読み込んだり、多数のツールを呼び出したりするコーディングエージェントを使用する開発者(例:デバッグ、コードベース監査)。
- 長時間で複数ターンのセッションを行うチーム – トークン節約は直接クラウドLLMのコスト削減と、コンテキスト制限に達するまでのターン数の増加につながります。
- エージェントコードを変更せずに即時導入可能なトークン削減レイヤーを求める人。
READMEからのリンク
- 論文 – arXiv: 2608.24188
- モデル – Hugging Face Hub
paritok/paritok-4b-v1 - Discordコミュニティ – https://discord.gg/SeBJE5Eucp
- VS Code 拡張 – https://github.com/Paritok-official/paritok-vscode
結論:Paritok は本物のオープンソースツールであり、同じLLMを維持しながら、選択的なツールフィルタリング、モデルベースの圧縮、スマートな要約によって入力トークンコストを劇的に削減できます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch