headroomlabs-ai/headroom
Compress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens for coding agents, 60-95% fewer tokens for JSON, same answers. Library, proxy, MCP server.
해결하는 문제
Headroom은 대규모 언어 모델(LLM)로 전송 및 수신하는 토큰 수를 줄여 AI 에이전트의 비용을 낮추고 지연을 감소시킵니다. 특히 도구 출력, 로그, RAG 청크, 대화 기록에서 흔히 발생하는 '의식적 반복' 데이터와 반복적인 정보에 초점을 맞추어 에이전트 프롬프트의 부풀어 오름을 방지합니다.
작동 방식
Headroom은 AI 에이전트와 LLM 제공자 사이에 위치하는 로컬 압축 레이어입니다. ContentRouter를 사용해 데이터 유형을 감지하고 적절한 압축 방법을 적용합니다:
- SmartCrusher: 통계적 변동성을 활용해 JSON 데이터를 처리하여 중요한 정보를 유지하면서 중복을 제거합니다.
- CodeCompressor: 추상 구문 트리(AST) 인식을 사용해 여러 언어의 소스 코드를 압축합니다.
- CodeCompressor: 에이전트 추적 데이터로 훈련된 전용 HuggingFace 모델(
Kompress-v2-base)을 사용해 문장 텍스트를 압축합니다. - CCR(역변환 가능한 압축): 원본 콘텐츠를 로컬에 저장하여 필요 시 도구 호출로 전체 텍스트를 복원할 수 있도록 합니다.
- CacheAligner: 변동성이 큰 콘텐츠가 제공자의 KV 캐시 접두사에 영향을 주지 않도록 보장하여 캐시 히트를 유지합니다.
라이브러리(파이썬/타입스크립트), 코드 변경 없이 바로 사용 가능한 프록시, 또는 Claude Code, Cursor, Aider와 같은 인기 에이전트용 래퍼로 배포할 수 있습니다.
대상 사용자
일상적으로 코드 에이전트를 사용하는 개발자 및 고급 사용자, 여러 다른 AI 에이전트를 사용하면서 공유 메모리 저장소를 원하는 사용자, 정확도를 희생하지 않고 LLM API 비용을 줄이고 싶은 누구나.
주요 기능
- 다중 모달 압축: JSON, 코드, 텍스트 전용 전용 압축기.
- 에이전트 래핑:
headroom wrap명령어 하나로 다양한 AI 에이전트와 IDE 확장 프로그램에 쉽게 적용 가능. - 출력 토큰 감소: 모델 응답을 일상적인 작업의 낭비적인 언어 사용을 줄이고 추론 노력 조정을 통해 단축합니다.
- 에이전트 간 메모리 공유: 다양한 LLM 제공자 간에 공유되고 중복 제거된 컨텍스트 저장소.
headroom learn: 실패한 세션을 분석해 자동으로 에이전트 설정 파일에 수정 사항을 기록합니다.- 로컬 실행: 모든 압축은 사용자 기기에서 수행되며, 압축을 위해 외부 서버로 데이터를 전송하지 않습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트