ryoiki-tokuiten/Deepthink
Using LLMs for iteratively exploring the solution search space at scale.
解決的問題
Iterative Studio (Deepthink) 設計用於擴展複雜問題解決的「測試時運算」。透過使用多代理流水線並行探索多種多樣的策略與假設,防止 LLM 在批判-修正循環中重複犯同樣的錯誤,陷入認知迴圈。
作法原理
此系統透過多種專用模式運作:
- Deepthink 模式:此模式使用複雜的迴圈,策略產生器創建多個並行的解決路徑分支。同時,假設產生器獨立測試特定的不確定性。為打破認知迴圈,一個「結構化解決方案池代理」會注入隨機的結構化雜訊(可能包含錯誤的產物或替代邏輯片段),強制模型考慮其通常會忽略的路徑。最終,一個裁判代理從這些並行執行中選擇最佳結果。
- 自適應 Deepthink 模式:由編排器主導的工作流程,用於管理分歧的戰略搜尋。它使用有限的內部修訂迴圈,以及用於產生策略、測試假設和保存成功分支狀態的工具。
- 上下文模式:一種更簡單的三代理協作(主產生器、迭代代理和記憶代理),專注於迭代優化和長期歷史壓縮,以在長時間會話中保持高品質輸出。
所有模式均與安全的沙箱虛擬環境整合,用於執行和驗證程式碼或產物。
適用對象
希望推動 LLM 推理能力邊界,透過實現高推理時間計算策略與多代理編排來應對困難基準或工程挑戰的開發者與研究人員。
主要亮點
- 並行策略探索:同時執行多種不同的問題解決方法,以找到最佳解。
- 打破認知迴圈:透過結構化雜訊注入,防止代理陷入重複錯誤模式。
- 機器人沙箱:整合的安全虛擬環境,支援即時執行與驗證工作成果。
- 假設測試:獨立代理測試關鍵不確定性,為主要執行分支提供聚焦的上下文。
- 多提供者支援:相容所有主要 LLM 提供者與本地模型。
相關
- 專案
- 專案
- 專案
- 專案
- 專案