優化 AI 代理代幣經濟學:構建自訂深度研究管線
優化 AI 代理代幣經濟學:構建自訂深度研究管線
代理研究的高成本
執行複雜的 AI 研究管線會導致代幣快速耗盡。一次標準的 /deep-research 執行可能會啟動超過 100 個代理,並排隊超過 100 個待驗證的主張,可能在短短 30 分鐘內燃燒掉高階訂閱限制(例如 Claude Max 5 倍),卻未產出最終綜合結果。
為了解決這個問題,我們開發了一套自訂的深度研究管線,以優化代幣消耗並提升輸出可靠性。透過從單一前沿模型轉為多模型協調策略,研究時間延長了約 10 倍,且月支出未增加。
模型協調與角色分配
效率的提升來自於將特定模型釘定於特定角色,根據其強項與成本分配,而不是對每個任務都使用最昂貴的模型。這可避免子代理「繼承」父代理的高成本模型問題。
協調堆疊
| 角色 | 模型 | 理由 |
|---|---|---|
| 搜尋 | Claude Sonnet 5 | 具備強大的代理表現;對大量搜尋而言成本效益高。 |
| 驗證 | Claude Opus 4.8 | 高精度;對檢查主張與引用至關重要。 |
| 判斷與規劃 | Claude Fable 5 | 最昂貴;保留給高階分解與爭議解決。 |
| 小任務 | Claude Haiku 4.5 | 快速且便宜,適合抽取與格式化。 |
| 執行工具 | Codex (GPT-5.5) | 在安裝與檢查的終端基準測試中表現優異。 |
| 第二意見 | Antigravity (Gemini 3.1 Pro) | 不同模型族系,以避免共同盲點。 |
跨供應商整合
為了利用多個現有訂閱(Claude、Codex 與 Antigravity),我們使用 Bash 包裝器讓 Claude 代理能以無頭子代理的方式呼叫其他供應商的 CLI。此方法將代幣使用分散至不同帳號,並提供自動回退機制:若某供應商觸發使用上限,協調器會將任務重新指派給 Claude 模型。
確保可信度與降低幻覺
僅靠成本優化無法保證準確性。為防止幻覺,管線實施嚴格的驗證規則:
- 關注點分離: 發現主張的代理永遠不會是驗證該主張的代理。
- 來源要求: 任何進入知識庫的發現必須附有 URL 與原始來源的直接引用。
- 文字精確性: 模型不得陳述在來源頁面上未明確出現的數字。
這些規則會不斷迭代;每當驗證步驟捕捉到新類型的錯誤時,規則就會被加入系統提示中。然而,人為監督仍是必須的。自動規則過於僵硬的例子:一次因「未驗證的主張」規則導致管線省略了一個大型產業專案,因為該專案的自我行銷主張未經品質控制。解決方式是將規則細化為僅拒絕特定主張,而非整個專案。
策略性管線排序
操作順序對代幣效率影響甚大。管線不再以寬泛的 /deep-research 指令作為起點,而是遵循以下序列:
- 搜尋與驗證: 低成本模型搜尋資料,高精度模型驗證。
- 判斷與執行: 高階模型規劃並執行基於工具的證據收集。
- 深度驗證: 多數投票加上人工批准流程。
- 最終綜合:
/deep-research作為 最終 步驟,用於深化已有發現與填補空白,而非盲目瀏覽網路。此舉減少所需代理數量,並確保工具僅處理固定的主張清單。
代幣經濟學的關鍵發現
透過此管線進行的研究揭示了 AI 代理消耗代幣的若干關鍵洞見:
- 框架影響: 執行模型的框架(harness)會導致相同模型的代幣使用出現 66 倍的差異,較輕量的設定往往能取得更佳表現。
- 上下文壓縮風險: 自動上下文壓縮可能產生「壓縮迴圈」,模型先摘要歷史、驅除必要檔案,之後又重新讀取,導致帳單翻倍。
- 快取失效: 在會話中新增或重新排序單一工具 schema 可能使整個快取前綴失效,導致會話重新以全價計費。
- 估算落差: 簡易代幣計數器常低估實際帳單。某些情況下,計算出的 $3.60/月成本最終卻因重試放大與框架開銷而變成 $25‑40/月。
社群觀點與反思
雖然管線方法提供了結構化的成本管理方式,社群討論仍提出其他策略與潛在陷阱:
"大多數人耗盡配額的原因主要是子代理。停止使用它們,你會發現即使是 Pro 等級也足以支撐每日 8‑12 小時的編程工作。"
其他貢獻者建議聚焦本地 LLM,以避免供應商鎖定並降低成本:
"我一開始就沒買代幣,而是購買 GPU… 使用大型/雲端 LLM 幫你『找到足夠好的設定』,再在本地/小型 llm 上運行。"
此外,也有人認為幻覺問題無法僅靠規則或其他模型完全解決,認為 LLM 的本質使「零幻覺」成為不可能的目標。
摘要
為降低成本與幻覺,自訂研究管線透過模型協調將不同 LLM 分配至特定角色,結合共享本地記憶與人機驗證流程。
標題
優化 AI 代理代幣經濟學:構建自訂深度研究管線