ryoiki-tokuiten/Deepthink

Using LLMs for iteratively exploring the solution search space at scale.

解决的问题

Iterative Studio (Deepthink) 旨在为复杂问题求解扩展「测试时计算」。通过使用多代理流水线并行探索多种多样化的策略和假设,防止 LLM 在批判-修正循环中反复犯同样的错误,陷入认知循环。

工作原理

该系统通过多种专用模式运行:

  • Deepthink 模式:此模式采用复杂的循环机制,策略生成器创建多个并行的解决路径分支。同时,假设生成器独立测试特定的不确定性。为打破认知循环,一个「结构化解决方案池代理」会注入随机的结构化噪声(可能包含错误的产物或替代逻辑片段),强制模型考虑其通常会忽略的路径。最终,一个裁判代理从这些并行执行中选择最佳结果。
  • 自适应 Deepthink 模式:由编排器主导的工作流,用于管理分歧的战略搜索。它使用有限的内部修订循环,以及用于生成策略、测试假设和保存成功分支状态的工具。
  • 上下文模式:一种更简单的三代理协作(主生成器、迭代代理和记忆代理),专注于迭代优化和长期历史压缩,以在长时间会话中保持高质量输出。

所有模式均与安全的沙箱虚拟环境集成,用于执行和验证代码或产物。

适用人群

希望推动 LLM 推理能力边界,通过实现高推理时间计算策略和多代理编排来应对困难基准或工程挑战的开发者和研究人员。

主要亮点

  • 并行策略探索:同时执行多个不同的问题解决方法,以找到最优解。
  • 打破认知循环:通过结构化噪声注入,防止代理陷入重复错误模式。
  • 机器人沙箱:集成的安全虚拟环境,支持实时执行和验证工作成果。
  • 假设测试:独立代理测试关键不确定性,为主要执行分支提供聚焦的上下文。
  • 多提供方支持:兼容所有主要 LLM 提供方和本地模型。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目