agentic-in/inferoa
Inference-native Tokenmaxxing Agent Harness for Loop Engineering
What it solves
Inferoa 解決了長期迴路代理中出現的低效問題。當 AI 代理執行遞迴任務時,常會遭遇「提示漂移」、快取重用崩潰,以及充斥過時證據的龐大上下文視窗,這會提升成本並降低效能。
How it works
它提供一個針對推理的原生執行環境,將代理迴路視為推理工作負載。透過「tokenmaxxing」優化流程,保留可快取的提示前綴、限制可變上下文,並使用智慧模型路由(透過 vLLM)根據當前任務需求選擇最具成本效益的模型路徑。
Who it’s for
適合開發者與工程師,構建需要耐久迴路的複雜遞迴 AI 代理,以便於檢查、編輯、測試與驗證,且不浪費 token 或失去上下文連續性。
Highlights
- Loop Engineering: 一個
/loop指令,可在多個任務與嘗試之間維持目標,直至工作得到驗證。 - Tokenmaxxing: 工具可監控與優化 token 壓力、前綴快取重用與上下文節省。
- Inference-native Routing: 與 vLLM 整合,根據成本、安全、隱私與能力路由請求。
- Context Control: 使用壓縮、摘要與圖形化的倉庫上下文,保持視窗中不含過時狀態。