Hugging Face AI Agent 術語表:定義 Harness、Scaffold 與 Agent 架構

Hugging Face AI Agent 術語表:定義 Harness、Scaffold 與 Agent 架構

Hugging Face 發布了一份技術術語表,旨在將快速演進的 AI Agent 詞彙標準化。核心觀點是 Agent = Model + Harness,其中模型提供推理能力,而 harness 提供執行迴圈與環境互動。

核心 Agent 架構

AI Agent 不僅僅是一個大型語言模型 (LLM),而是一個將原始文本生成轉化為「觀察、決策與行動」迴圈的系統。此架構分為三個主要組成部分:

The Model

模型是底層的 LLM(例如 Claude、GPT、DeepSeek),負責接收文本輸入並產生文本輸出。模型本身在呼叫之間沒有記憶,也沒有執行迴圈;它可以表達使用工具的意圖,但無法獨立執行該工具。

Scaffolding

Scaffolding 是定義行為的層級,塑造了模型感知世界並在其中行動的方式。它包括:

  • System prompts 與工具描述。
  • Context management,決定模型在不同步驟之間能記住什麼。
  • Response parsing 邏輯。

雖然某些產品使用「harness」一詞來描述圍繞模型的整個系統,但在思考訓練流程時,區分 scaffold 與 harness 是至關重要的。

Harness

Harness 是讓 Agent 運行的執行層。它負責呼叫模型、處理工具呼叫,並決定 Agent 何時應該停止。

Harness engineering 是設計此層級的學問,專注於錯誤處理、護欄 (guardrails) 與終止條件。這適用於推理與評估,在評估中,「eval harness」會執行固定場景以記錄指標,而非更新模型權重。

運作概念

Context Engineering 與 Memory

Context engineering 是設計進入 Agent 上下文窗口 (context window) 內容的過程,包括 system prompts、檢索到的知識與對話歷史。這是一個由 harness 管理的動態過程。

  • Short-term memory:在單次執行期間保留在上下文窗口中的資訊(例如工具結果)。
  • Long-term memory:儲存在外部並在不同會話中根據需求檢索的資訊。

Policy 與 Tool Use

  • Policy:Agent 遵循的行為,定義了在任何給定情況下採取特定行動的機率。Policy 是模型權重結合 scaffolding 與 harness 的結果。
  • Tool Use:Agent 與外部系統(APIs、資料庫、程式碼解釋器)互動的機制。模型以結構化格式表達意圖,接著由 harness 將其路由至適當的函式。

Skills 與 Sub-agents

  • Skills:用於完成多步驟目標(例如「調查一個 bug」)的可重複使用、結構化知識包;而 tool 則是單一動作(例如「執行一個指令」)。
  • Sub-agents:由主 Agent(編排者)呼叫以處理特定子任務的獨立 Agent。與 tools 或 skills 不同,sub-agents 可以進行推理、使用自己的工具並呼叫進一步的 sub-agents。

AI Agent 訓練術語

對於開發模型的人來說,Hugging Face 識別了強化學習 (RL) 訓練流程的四個關鍵組成部分:

  • RL Environment:一個有狀態的物件,接收一個動作(通常是工具呼叫)並返回一個觀察結果(例如檔案系統在執行 touch 指令後返回檔案列表)。
  • Trainer:執行 Agent 軌跡 (episodes)、評分結果並更新內部模型權重的系統(例如 TRL 的 GRPOTrainer)。
  • Rollout:從開始到結束的完整 Agent 執行過程,也稱為 trajectorytrace。這為 RL 演算法提供了原始數據。
  • Reward:用於更新權重的分數。Reward 可以是可驗證的 (pass/fail)、學習到的 (人類偏好)、稀疏的 (單一回合結束分數) 或稠密的 (每一步的分數)。Rubrics 被用於將 reward 拆解為加權的顯性維度。

Sources