Hugging Face AI Agent Glossary: Defining Harness, Scaffold, and Agent Architecture
Hugging Face AI Agent Glossary: Defining Harness, Scaffold, and Agent Architecture
Hugging Face 已发布一份技术术语表,以标准化 AI 代理快速发展的词汇表。核心要点是 Agent = Model + Harness,其中模型提供推理,harness 提供执行循环和环境交互。
核心代理架构
AI 代理不仅仅是一个大型语言模型(LLM),而是一个将原始文本生成转化为观察、决策和行动循环的系统。此架构分为三个主要组成部分:
模型
模型是底层的 LLM(例如 Claude、GPT、DeepSeek),它接受文本输入并产生文本输出。单独来看,模型在调用之间没有记忆,也没有执行循环;它可以表达使用工具的意图,但无法独立执行该工具。
Scaffolding
Scaffolding 是定义行为的层,它塑造了模型如何感知和在世界中行动。它包括:
- System prompts 和工具描述。
- Context management,决定模型在各步骤中记住什么。
- Response parsing 逻辑。
虽然一些产品使用 "harness" 这个术语来描述围绕模型的整个系统,但 scaffold 和 harness 之间的区别在推理训练管道时至关重要。
Harness
Harness 是使代理运行的执行层。它负责调用模型、处理工具调用以及决定代理何时停止。
Harness engineering 是设计此层的学科,重点在于错误处理、防护措施和终止条件。这既适用于推理也适用于评估,其中 "eval harness" 会运行固定场景以记录指标,而不是更新模型权重。
运营概念
上下文工程与记忆
上下文工程是设计进入代理上下文窗口内容的过程,包括系统提示、检索到的知识和对话历史。这是一个由 harness 管理的动态过程。
- 短期记忆:在单次运行期间保持在上下文窗口中的信息(例如工具结果)。
- 长期记忆:存储在外部并在不同会话中按需检索的信息。
策略与工具使用
- 策略:代理所遵循的行为,定义在任何给定情况下采取特定行动的概率。策略是模型权重与 scaffolding 和 harness 结合的结果。
- 工具使用:代理与外部系统(API、数据库、代码解释器)交互的机制。模型以结构化格式表达意图,然后由 harness 将其路由到适当的函数。
技能与子代理
- 技能:可重用的、结构化的知识包,用于完成多步骤目标(例如 "调查一个错误"),而工具则是单一操作(例如 "运行一个命令")。
- 子代理:由主代理(编排器)调用以处理特定子任务的独立代理。与工具或技能不同,子代理可以进行推理、使用自己的工具,并调用更多的子代理。
AI 代理训练术语
对于正在开发模型的人员,Hugging Face 强化学习(RL)训练管道中确定了四个关键组成部分:
- RL Environment:有状态的对象,它接受一个动作(通常是工具调用)并返回一个观察(例如,文件系统在执行
touch命令后返回目录列表)。 - Trainer:运行代理情节、评分结果并更新内部模型权重的系统(例如 TRL 的
GRPOTrainer)。 - Rollout:从开始到结束的完整代理运行,也称为 轨迹 或 痕迹。这为 RL 算法提供了原始数据。
- Reward:用于更新权重的分数。奖励可以是 可验证的(通过/失败)、学习的(人类偏好)、稀疏的(单个情节结束时的分数)或 密集的(每一步的分数)。Rubrics 用于将奖励分解为带有显式权重的维度。