理解 AI 中的智能体框架 (Agent Harnesses)

智能体框架 (Agent Harness) 是一个围绕 AI 模型构建的软件环境,旨在为模型作为自主智能体运行提供必要的结构、工具和指令。虽然原始 AI 模型提供了“智能”,但框架提供了运行机制——有效地充当了模型权重与实际、面向任务的应用之间的桥梁。

智能体框架的四个核心组件

一个功能完备的智能体框架通常由四个主要的底层技术层组成,这些层决定了模型如何与用户及外部世界进行交互。

1. 系统提示词 (System Prompt)

系统提示词是一套基础指令,用于定义智能体的角色、规则和行为准则。与某些前沿模型中嵌入的训练或“灵魂文档”不同,系统提示词是在每次请求时注入到对话中的。这使得框架能够在无需重新训练底层模型的情况下,在特定上下文中规定模型的行为方式。

2. 工具 (Tools)

工具是用代码编写的可执行能力,模型可以通过“调用”这些工具来执行文本生成之外的操作。框架为这些工具提供软件支持——例如网络搜索、代码执行环境或电子邮件撰写——并向模型描述它们。至关重要的是,框架并不规定何时使用工具;它只是使工具可用,并允许模型决定哪个工具适合当前的任务。

3. 智能体循环 (Agentic Loops)

智能体循环是实现迭代推理和自我修正的框架。框架不再是单一的“提示-响应”交互,而是允许模型:

  • 分析请求。
  • 执行工具(例如,搜索网络)。
  • 审查结果。
  • 决定结果是否充分,或者是否需要进行另一次工具调用。
  • 重复此过程,直到达成目标。

4. 翻译层 (Translation Layer)

翻译层提供了模型无关性,允许单个框架与多种 AI 模型协同工作(例如,在 Anthropic、OpenAI 或开源权重模型之间切换)。这一层防止了供应商锁定,并使用户能够在保持相同的一套工具和系统提示词的同时,比较不同模型的成本和性能。

用户自主权与开源框架

拥有框架与使用专有 AI 应用有着本质的区别。当用户在本地运行框架时,他们可以保留对数据、会话历史以及智能体特定配置的控制权。

开源框架——例如 PiOpenClawOpenCodeHermes——允许用户通过扩展或修改系统提示词来定制自己的智能体。例如,Pi 框架旨在保持极简,允许用户构建并分享扩展程序,从而将智能体转化为股票交易员或软件工厂等专业化工具。

技术视角与行业类比

行业从业者和开发者将框架视为 AI 智能体的“电子元件”或“底盘”。各种类比有助于澄清模型与框架之间的关系:

  • 汽车类比: 模型是引擎,框架是底盘,Token 是燃料,最终生成的智能体就是汽车。
  • 硬件类比: 模型代表脑细胞的连接,而框架代表大脑与世界交互所需的一切其他要素。
  • 工具类比: 模型就像一匹马,而框架由用于将这种力量导向特定目标的马鞍和缰绳组成。

来自实现的工程见解

在为会计等专业领域实现框架的开发者们注意到,提供一个带有工具和护栏 (guardrails) 的灵活框架,通常比创建高度指令性的“技能”或指令清单更有效。当给予前沿模型在受控环境中独立推理解决问题的工具时,它们的表现往往优于僵化的脚本。

一些开发者还强调了“护栏”的重要性——即工具调用前的验证以确保数据格式正确,以及工具调用后的验证以核实输出——以此作为提高智能体循环可靠性的手段。

Sources

相关

  • Dispatch
  • Dispatch
  • 项目
  • Dispatch
  • 项目