headroomlabs-ai/headroom

Compress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens for coding agents, 60-95% fewer tokens for JSON, same answers. Library, proxy, MCP server.

解決する課題

Headroom は、大規模言語モデル(LLM)に送信および受信するトークン数を削減し、AIエージェントのコストを低下させ、遅延を軽減します。特に、ツール出力、ログ、RAGチャンク、会話履歴に見られる「儀式的な」繰り返しデータに焦点を当て、エージェントプロンプトの肥大化を防ぎます。

動作方法

Headroom は、AIエージェントとLLMプロバイダーの間に位置するローカルな圧縮レイヤーです。ContentRouter を使ってデータの種類を検出し、適切な圧縮手法を適用します:

  • SmartCrusher: 統計的分散を活用してJSONデータを処理し、重要な情報を保持しながら冗長性を削除します。
  • CodeCompressor: 抽象構文木(AST)の知識を活用して、複数言語のソースコードを圧縮します。
  • CodeCompressor: エージェントトレースで訓練された専用のHuggingFaceモデル(Kompress-v2-base)を使用して、文章を圧縮します。
  • CCR(逆変換可能な圧縮): 元のコンテンツをローカルに保存し、必要に応じてツール呼び出しで完全なテキストを取得可能にします。
  • CacheAligner: 動的コンテンツがプロバイダーのKVキャッシュのプレフィックスを破壊しないように保証し、キャッシュヒットを維持します。

ライブラリ(Python/TypeScript)、コード変更なしのドロップインプロキシ、またはClaude Code、Cursor、Aiderなどの人気エージェント用のラッパーとして導入可能です。

対象ユーザー

日常的にコードエージェントを使用する開発者やパワーユーザー、複数の異なるAIエージェントで作業するユーザーで、共有メモリストアを求める人、精度を損なわずにLLM APIコストを削減したい人。

特徴

  • マルチモーダル圧縮: JSON、コード、テキスト専用の圧縮器。
  • エージェントラッピング: headroom wrap 1コマンドで、多数のAIエージェントやIDE拡張に対応。
  • 出力トークン削減: モデルの応答を、冗長性を減らし、日常的なタスクの推論努力を調整することで短縮。
  • エージェント間メモリ共有: 異なるLLMプロバイダー間で共有され、重複削除されたコンテキストストア。
  • headroom learn: 失敗したセッションを分析し、自動的にエージェント設定ファイルに修正を書き込みます。
  • ローカル実行: すべての圧縮処理はユーザーのマシン上で行われ、圧縮のために外部サーバーにデータを送信しません。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト