gglucass/headroom-desktop

Headroom for macOS — cut Claude Code and Codex token costs by ~50%

解決する課題

Headroom は、Claude Code や OpenAI Codex などの AI コーディングアシスタントを使用する際に発生するトークンコストを削減することを目的としています。特に、プロンプト内の「ボリュームの増大」——具体的にはツール出力、ログ、ボイラープレートコード——が、AIの推論プロセスに必要な価値を追加せずにコストを増加させることに焦点を当てています。

動作方法

Headroom は、コードクライアントと LLM API の間でローカル優先のプロキシとして動作します。Rust で作成されたインターセプトプロキシと Python の最適化バックエンドを用いた二ホップのローカルプロキシシステムにより、API に送信される前にコンテンツを圧縮します。

主なメカニズムは以下の通りです:

  • 管理された Python ランタイム:システムの Python を影響させずに最適化ツールを実行できる、隔離された Python 環境をインストールします。
  • トークン節約ツールheadroom を用いたプロンプト最適化や、CLI 出力を圧縮する rtk などのツールをバンドルしています。
  • 逆転可能な圧縮:圧縮されたデータは、必要に応じて元の内容を再取得できるように設計されています。
  • クライアント統合:Claude Code は settings.json、Codex は config.toml を介して自動的にローカルプロキシ経由で通信をルーティングするよう設定されます。

対象ユーザー

Claude Code や OpenAI Codex を使用し、コーディングワークフローを変更せずに API コストを下げ、トークン制限を延長したい開発者。

特徴

  • 顕著なコスト削減:ベンチマークでは HTML 抽出で最大 94.9%、JSON ログで最大 87.6% の圧縮が実現。
  • ホストへの影響ゼロ:アプリは自身の依存関係を管理し、終了またはアンインストール時にすべてのシステムおよび設定変更を完全に元に戻します。
  • ローカル優先のプライバシー:最終的な API 呼び出し前に、すべての処理が 127.0.0.1 上で行われます。
  • 分析ダッシュボード:日次・月次での節約額チャートと、各クライアントごとのトークン統計を提供。
  • 保守的なコード保護:意図的にアクティブなソースコードの圧縮を回避し、デバッグや分析タスクにおける正確性を確保。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト