headroomlabs-ai/headroom
Compress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens for coding agents, 60-95% fewer tokens for JSON, same answers. Library, proxy, MCP server.
解決する課題
Headroom は、大規模言語モデル(LLM)に送信および受信するトークン数を削減し、AIエージェントのコストを低下させ、遅延を軽減します。特に、ツール出力、ログ、RAGチャンク、会話履歴に見られる「儀式的な」繰り返しデータに焦点を当て、エージェントプロンプトの肥大化を防ぎます。
動作方法
Headroom は、AIエージェントとLLMプロバイダーの間に位置するローカルな圧縮レイヤーです。ContentRouter を使ってデータの種類を検出し、適切な圧縮手法を適用します:
- SmartCrusher: 統計的分散を活用してJSONデータを処理し、重要な情報を保持しながら冗長性を削除します。
- CodeCompressor: 抽象構文木(AST)の知識を活用して、複数言語のソースコードを圧縮します。
- CodeCompressor: エージェントトレースで訓練された専用のHuggingFaceモデル(
Kompress-v2-base)を使用して、文章を圧縮します。 - CCR(逆変換可能な圧縮): 元のコンテンツをローカルに保存し、必要に応じてツール呼び出しで完全なテキストを取得可能にします。
- CacheAligner: 動的コンテンツがプロバイダーのKVキャッシュのプレフィックスを破壊しないように保証し、キャッシュヒットを維持します。
ライブラリ(Python/TypeScript)、コード変更なしのドロップインプロキシ、またはClaude Code、Cursor、Aiderなどの人気エージェント用のラッパーとして導入可能です。
対象ユーザー
日常的にコードエージェントを使用する開発者やパワーユーザー、複数の異なるAIエージェントで作業するユーザーで、共有メモリストアを求める人、精度を損なわずにLLM APIコストを削減したい人。
特徴
- マルチモーダル圧縮: JSON、コード、テキスト専用の圧縮器。
- エージェントラッピング:
headroom wrap1コマンドで、多数のAIエージェントやIDE拡張に対応。 - 出力トークン削減: モデルの応答を、冗長性を減らし、日常的なタスクの推論努力を調整することで短縮。
- エージェント間メモリ共有: 異なるLLMプロバイダー間で共有され、重複削除されたコンテキストストア。
headroom learn: 失敗したセッションを分析し、自動的にエージェント設定ファイルに修正を書き込みます。- ローカル実行: すべての圧縮処理はユーザーのマシン上で行われ、圧縮のために外部サーバーにデータを送信しません。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト