agentic-in/inferoa

Inference-native Tokenmaxxing Agent Harness for Loop Engineering

What it solves

Inferoa 解決了長期迴路代理中出現的低效問題。當 AI 代理執行遞迴任務時,常會遭遇「提示漂移」、快取重用崩潰,以及充斥過時證據的龐大上下文視窗,這會提升成本並降低效能。

How it works

它提供一個針對推理的原生執行環境,將代理迴路視為推理工作負載。透過「tokenmaxxing」優化流程,保留可快取的提示前綴、限制可變上下文,並使用智慧模型路由(透過 vLLM)根據當前任務需求選擇最具成本效益的模型路徑。

Who it’s for

適合開發者與工程師,構建需要耐久迴路的複雜遞迴 AI 代理,以便於檢查、編輯、測試與驗證,且不浪費 token 或失去上下文連續性。

Highlights

  • Loop Engineering: 一個 /loop 指令,可在多個任務與嘗試之間維持目標,直至工作得到驗證。
  • Tokenmaxxing: 工具可監控與優化 token 壓力、前綴快取重用與上下文節省。
  • Inference-native Routing: 與 vLLM 整合,根據成本、安全、隱私與能力路由請求。
  • Context Control: 使用壓縮、摘要與圖形化的倉庫上下文,保持視窗中不含過時狀態。