open-compress/claw-compactor
14-stage Fusion Pipeline for LLM token compression — reversible compression, AST-aware code analysis, intelligent content routing. Zero LLM inference cost. MIT licensed.
What it solves
Claw Compactor は、Large Language Models(LLMs)の高コストと限られたコンテキストウィンドウという課題を、重要な構造データを破壊せずにプロンプトに必要なトークン数を削減することで解決します。汎用圧縮ツールとは異なり、コードの識別子や JSON キー、ログパターンといった、パープレキシティベースの圧縮手法で削除されがちな情報を保持します。
How it works
本プロジェクトは 14 段階の "Fusion Pipeline" を採用し、テキストが一連の専門圧縮器を順に通過します。各ステージはゲート制御されており、コンテンツタイプ(コード、JSON、ログ、diff など)がステージの目的に合致した場合にのみ実行されます。
主なメカニズムは次のとおりです:
- Content-Aware Routing:言語とコンテンツタイプを自動検出し、適切な圧縮ロジックを適用します。
- AST-Aware Analysis:tree-sitter を利用して、識別子を短縮せずにコードを圧縮します。
- Reversible Compression:元のコンテンツをハッシュアドレス化された
RewindStoreに保存し、必要に応じてマーカー ID を介して LLM が完全な元テキストを取得できるようにします。 - Immutable Data Flow:各ステージはデータをその場で変更せず新しい結果を生成し、安定性を確保します。
Who it’s for
大量のワークスペースコンテキスト、ログ、構造化データをモデルに供給しつつ、レイテンシと API コストを最小化したい AI エージェントや LLM アプリケーションの開発者向けです。
Highlights
- Zero Inference Cost:圧縮は LLM 呼び出しを必要としません。
- High Fidelity:LLMLingua-2 などのツールに比べ、セマンティックコンテンツ(ROUGE-L スコア)が高く保たれます。
- Versatile Stages:base64 画像、simhash 重複除去、JSON サンプリング、git diff 折りたたみ用の専門ハンドラを含みます。
- Extensible:開発者がカスタム圧縮ステージをパイプラインに追加可能です。