Hugging Face AI Agent 術語表:定義 Harness、Scaffold 與 Agent 架構
Hugging Face AI Agent 術語表:定義 Harness、Scaffold 與 Agent 架構
Hugging Face 發布了一份技術術語表,旨在將快速演進的 AI Agent 詞彙標準化。核心觀點是 Agent = Model + Harness,其中模型提供推理能力,而 harness 提供執行迴圈與環境互動。
核心 Agent 架構
AI Agent 不僅僅是一個大型語言模型 (LLM),而是一個將原始文本生成轉化為「觀察、決策與行動」迴圈的系統。此架構分為三個主要組成部分:
The Model
模型是底層的 LLM(例如 Claude、GPT、DeepSeek),負責接收文本輸入並產生文本輸出。模型本身在呼叫之間沒有記憶,也沒有執行迴圈;它可以表達使用工具的意圖,但無法獨立執行該工具。
Scaffolding
Scaffolding 是定義行為的層級,塑造了模型感知世界並在其中行動的方式。它包括:
- System prompts 與工具描述。
- Context management,決定模型在不同步驟之間能記住什麼。
- Response parsing 邏輯。
雖然某些產品使用「harness」一詞來描述圍繞模型的整個系統,但在思考訓練流程時,區分 scaffold 與 harness 是至關重要的。
Harness
Harness 是讓 Agent 運行的執行層。它負責呼叫模型、處理工具呼叫,並決定 Agent 何時應該停止。
Harness engineering 是設計此層級的學問,專注於錯誤處理、護欄 (guardrails) 與終止條件。這適用於推理與評估,在評估中,「eval harness」會執行固定場景以記錄指標,而非更新模型權重。
運作概念
Context Engineering 與 Memory
Context engineering 是設計進入 Agent 上下文窗口 (context window) 內容的過程,包括 system prompts、檢索到的知識與對話歷史。這是一個由 harness 管理的動態過程。
- Short-term memory:在單次執行期間保留在上下文窗口中的資訊(例如工具結果)。
- Long-term memory:儲存在外部並在不同會話中根據需求檢索的資訊。
Policy 與 Tool Use
- Policy:Agent 遵循的行為,定義了在任何給定情況下採取特定行動的機率。Policy 是模型權重結合 scaffolding 與 harness 的結果。
- Tool Use:Agent 與外部系統(APIs、資料庫、程式碼解釋器)互動的機制。模型以結構化格式表達意圖,接著由 harness 將其路由至適當的函式。
Skills 與 Sub-agents
- Skills:用於完成多步驟目標(例如「調查一個 bug」)的可重複使用、結構化知識包;而 tool 則是單一動作(例如「執行一個指令」)。
- Sub-agents:由主 Agent(編排者)呼叫以處理特定子任務的獨立 Agent。與 tools 或 skills 不同,sub-agents 可以進行推理、使用自己的工具並呼叫進一步的 sub-agents。
AI Agent 訓練術語
對於開發模型的人來說,Hugging Face 識別了強化學習 (RL) 訓練流程的四個關鍵組成部分:
- RL Environment:一個有狀態的物件,接收一個動作(通常是工具呼叫)並返回一個觀察結果(例如檔案系統在執行
touch指令後返回檔案列表)。 - Trainer:執行 Agent 軌跡 (episodes)、評分結果並更新內部模型權重的系統(例如 TRL 的
GRPOTrainer)。 - Rollout:從開始到結束的完整 Agent 執行過程,也稱為 trajectory 或 trace。這為 RL 演算法提供了原始數據。
- Reward:用於更新權重的分數。Reward 可以是可驗證的 (pass/fail)、學習到的 (人類偏好)、稀疏的 (單一回合結束分數) 或稠密的 (每一步的分數)。Rubrics 被用於將 reward 拆解為加權的顯性維度。