headroomlabs-ai/headroom
Compress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens for coding agents, 60-95% fewer tokens for JSON, same answers. Library, proxy, MCP server.
解決する課題
Headroomは、LLMに送信および受信されるトークン数を削減するために設計されたコンテキスト圧縮レイヤーです。ツール出力、ログ、RAGチャンク、ファイル、会話履歴を圧縮することで、AIエージェントの高コスト化とトークン制限の問題に対処します。精度を損なうことなく、JSONでは60-95%、コーディングエージェントでは15-20%のトークン削減を実現することがよくあります。
仕組み
Headroomは、AIエージェントとLLMプロバイダーの間に位置する、ローカルファーストのプロキシ、ライブラリ、またはMCPサーバーとして動作します。ContentRouterを使用してコンテンツタイプを検出し、特定のコンプレッサーを適用します:
- SmartCrusher: JSONデータ用。
- CodeCompressor: 複数のプログラミング言語に対応したAST認識圧縮。
- Kompress-v2-base: 文章/テキスト用の特化型HuggingFaceモデル。
- CacheAligner: プロバイダーのKVキャッシュヒットを最大化するために、プレフィックスが安定するようにします。
- CCR (Reversible Compression): オリジナルコンテンツをローカルにキャッシュし、必要に応じてLLMがツールコールを通じて完全なバージョンを取得できるようにします。
また、モデルを簡潔な回答へと誘導し、定型的なステップの推論負荷を調整することで、出力トークンも削減します。
対象ユーザー
- コストとレイテンシを下げたいAIコーディングエージェント(Claude Code, Cursor, Aiderなど)の利用者。
- 異なるLLM間で共有・重複排除されたメモリを必要とするマルチエージェントワークフローを構築するチーム。
- PythonまたはTypeScript SDKを介してLLMアプリケーションを統合する開発者。
ハイライト
- 複数のデプロイモード: ドロップインプロキシ、インラインライブラリ、またはMCPサーバーとして利用可能。
- エージェントのラッピング: 幅広いエージェント(例:Claude Code, Copilot CLI, Grok)をワンコマンドでラッピング可能。
- 出力削減: モデルのプリアンブルをトリミングし、推論負荷を調整して、高価な出力トークンを節約。
- クロスエージェントメモリ: Gemini, Grok, Claudeなどの異なるプロバイダー間で動作する共有コンテキストストア。
- 失敗のマイニング:
headroom learnコマンドが失敗したセッションを分析し、エージェントの設定ファイルに修正を書き込みます。