Paritok-official/paritok-4b-v1

Non-destructive compression gateway for AI coding agents. Cuts token bills 25% on turn 1 to past 85% in long or saturated sessions, and fits ~3× more turns in the same context window. Powered by our open-source code-native 4B model. Drop-in for Claude Code, Cursor, Codex, OpenHands, and any BASE_URL agent.

Paritok — コーディングエージェント向けのトークン節約プロキシ

何であるか – Paritok は、コーディングアシスタント(Claude Code、Cursor、Codex、OpenHands など)と下位の LLM API の間に配置されるオープンソースで即時導入可能なプロキシです。各リクエストを再書き換えし、トークン使用量の3つの主要な要因を削減します:

  1. ツールスキーマフィルタ – 現在のユーザーの意図に関連するツールのみを保持し、それ以外は軽量なスタブに置き換えます。
  2. コンテンツ圧縮 – 45K の実際のエージェントトラジェクトリで訓練された 4B パラメータモデルを使用して、ファイル読み取り、ツール出力、古くなった履歴を元のサイズの約26%に圧縮し、[REF:id] プレースホルダーでタグ付けします。
  3. 履歴要約 – 会話がモデルのコンテキストウィンドウを超えると、古いトーンを要約してセッションがウィンドウ内に収まるようにします。

すべての圧縮は 非破壊的 です:エージェントはいつでも元のテキストを要求できます(read_original / expand_context)。エージェントのコード変更は一切不要です。エージェントの BASE_URL(例:ANTHROPIC_BASE_URL または OPENAI_BASE_URL)を Paritok サーバーに設定するだけです。


主要コンポーネント

コンポーネント 機能 配布方法
Paritok ゲートウェイ HTTPミドルウェアでリクエストを再書き換えし、実際の LLM に転送し、必要に応じて圧縮された参照を展開します。 Pythonパッケージ(paritok[proxy])、paritok up / paritok proxy として実行可能
4B 圧縮モデル アイデンティファイア、パス、エラーメッセージなどを保持しながら、周囲のノイズを削除する学習をします。 Hugging Face(paritok/paritok-4b-v1)で配布され、Ollama(GGUF)または vLLM で利用可能
埋め込みベースのツールフィルタ 小さな CPU専用埋め込みモデル(BAAI/bge-small-en-v1.5)を使用してツールスキーマをランク付けし、関連するもののみを保持します。 paritok[toolselect] と一緒にインストール
ダッシュボード / VS Code 拡張 各リクエストごとのトークン節約のライブ表示と、機能の切り替え用 UI。 別のリポジトリ(paritok-vscode)と /stats エンドポイント

報告された節約効果

  • 単一ターン:入力トークンが約25%削減(典型的な Claude Code ターンは約96K から約72K に減少)。
  • 複数ターン:節約効果が累積。ターン5で約39%、ターン10で約54%、200K コンテキスト予算では 約72% の上限に達します。
  • コストへの影響:Claude Sonnet($3 / M 入力トークン)の場合、20ターンのセッションは $0.75 から $0.28 に低下します。

クイックスタート(セルフホスト、クローン不要)

# プロキシのインストール(ゲートウェイとCLIを含む)
pip install "paritok[proxy]"

# Ollamaでモデルを取得(初回のみ約2.5GB)
paritok up          # `paritok-4b-v1` を取得し、ポート8080でプロキシを起動

このターミナルを起動したままにして、別のシェルでエージェントをプロキシに接続します:

export ANTHROPIC_BASE_URL=http://127.0.0.1:8080   # Claude Code / Cursor / …
# 通常のプロバイダーアクセスキー(例:ANTHROPIC_API_KEY)をそのまま設定

エージェントは変更なしで動作します。Paritok はリクエストを転送する前に静かに圧縮します。


デプロイオプション

オプション 必要なハードウェア 実行方法
セルフホスト(デフォルト) 小さな埋め込みモデル用にCPU;4Bモデル用にGPU(OllamaまたはvLLM経由でオプション)。 paritok up(Ollama)または vllm serve … + paritok proxy
ホストGPUサービス なし – SaaSエンドポイント paritok.com を使用。 paritok.yamluse_gpu_server: true を設定し、APIキーを提供

両方とも Apache-2.0 ライセンスで、ローカルで無料で実行可能です。


誰が恩恵を受けるか?

  • 大きなファイルを繰り返し読み込んだり、多数のツールを呼び出したりするコーディングエージェントを使用する開発者(例:デバッグ、コードベース監査)。
  • 長時間で複数ターンのセッションを行うチーム – トークン節約は直接クラウドLLMのコスト削減と、コンテキスト制限に達するまでのターン数の増加につながります。
  • エージェントコードを変更せずに即時導入可能なトークン削減レイヤーを求める人。

READMEからのリンク


結論:Paritok は本物のオープンソースツールであり、同じLLMを維持しながら、選択的なツールフィルタリング、モデルベースの圧縮、スマートな要約によって入力トークンコストを劇的に削減できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch