agentic-in/inferoa

Inference-native Tokenmaxxing Agent Harness for Loop Engineering

What it solves

Inferoa는 장기 에이전트 루프에서 발생하는 비효율성을 해결합니다. AI 에이전트가 재귀 작업을 수행할 때 종종 "프롬프트 드리프트"와 캐시 재사용 붕괴, 오래된 증거로 가득 찬 거대한 컨텍스트 윈도우가 발생하여 비용이 증가하고 성능이 저하됩니다.

How it works

에이전트 루프를 추론 워크로드로 취급하는 추론 네이티브 런타임을 제공합니다. "tokenmaxxing"을 통해 캐시 가능한 프롬프트 접두사를 보존하고, 가변 컨텍스트를 제한하며, vLLM을 통한 지능형 모델 라우팅으로 현재 작업 요구에 가장 비용 효율적인 모델 경로를 선택합니다.

Who it’s for

복잡하고 재귀적인 AI 에이전트를 구축하고, 검사, 편집, 테스트 및 검증을 위해 내구성 있는 루프가 필요한 개발자와 엔지니어를 위한 것입니다. 토큰을 낭비하거나 컨텍스트 연속성을 잃지 않도록 합니다.

Highlights

  • Loop Engineering: 작업이 검증될 때까지 여러 작업과 시도를 걸쳐 목표를 유지하는 /loop 명령.
  • Tokenmaxxing: 토큰 압력, 접두사 캐시 재사용 및 컨텍스트 절감을 모니터링하고 최적화하는 도구.
  • Inference-native Routing: 비용, 안전성, 프라이버시 및 기능에 따라 요청을 라우팅하는 vLLM과의 통합.
  • Context Control: 압축, 요약 및 그래프 형태의 저장소 컨텍스트를 사용하여 윈도우를 오래된 상태에서 깨끗하게 유지합니다.