agentic-in/inferoa

Inference-native Tokenmaxxing Agent Harness for Loop Engineering

What it solves

Inferoa 解决了长周期代理循环中出现的低效问题。随着 AI 代理执行递归任务,它们常常会遭遇“提示漂移”、缓存复用崩溃以及充斥过时证据的庞大上下文窗口,这会增加成本并降低性能。

How it works

它提供一个推理原生运行时,将代理循环视为推理工作负载。通过“tokenmaxxing”优化过程,保留可缓存的提示前缀、限制可变上下文,并使用智能模型路由(通过 vLLM)根据当前任务需求选择最具成本效益的模型路径。

Who it’s for

适用于开发者和工程师,构建需要持久循环的复杂递归 AI 代理,以便检查、编辑、测试和验证,且不浪费 token 或失去上下文连续性。

Highlights

  • Loop Engineering: 一个 /loop 命令,可在多个任务和尝试之间保持目标,直至工作得到验证。
  • Tokenmaxxing: 工具用于监控和优化 token 压力、前缀缓存复用和上下文节省。
  • Inference-native Routing: 与 vLLM 集成,根据成本、安全、隐私和能力路由请求。
  • Context Control: 使用压缩、摘要和图形化的仓库上下文,保持窗口中不含过时状态。