Claude System Prompts: Analysis of Anthropic's Model Steering
Anthropic 已發佈 Claude 網頁介面與行動應用程式所使用的系統提示詞(system prompts)。這些提示詞作為引導 Claude 行為的基礎指令,提供即時上下文(例如當前日期),並在使用者發送訊息之前強制執行安全護欄。
System Prompt Evolution and Scale
Claude 的系統提示詞長度已呈指數級增長,從早期版本的約 300 字增加到最新迭代版本中的 3,000 字以上(甚至高達 22,000 個字元)。 這表明其正轉向使用系統提示詞作為行為控制的主要機制,而非僅僅依賴模型權重。
關於規模與結構的關鍵觀察包括:
- 第三人稱指令: 與許多以第二人稱("You are...")撰寫的業界提示詞不同,Claude 的提示詞是以第三人稱("Claude avoids...")撰寫的,開發者注意到這是一種潛在的實驗性風格選擇。
- Snapshot Versioning: 從 Claude 4.6 代開始,模型 ID 是固定的快照(snapshots),這意味著它們擁有單一且不變的系統提示詞條目。
- API Exclusion: 這些系統提示詞專用於面向消費者的網頁與行動應用程式;它們不適用於 Claude API,開發者在 API 中會提供自己的系統指令。
Behavioral Steering and Guardrails
Anthropic 使用系統提示詞來硬編碼(hardcode)特定的事實更新與行為約束,這些是模型僅透過訓練無法學到的。 這涵蓋了從政治事實到人際互動動態的所有內容。
Hardcoded Knowledge and Safety
- Fact Injection: 提示詞中包含明確的信息塊,以確保對近期事件的準確性。例如,Opus 4.6 的提示詞明確指出 Donald Trump 在 2024 年美國總統大選中獲勝,並於 2025 年 1 月 20 日就職。
- Routing Logic: Opus 5 的提示詞包含處理從 Claude Fable 5 因安全路由而重定向的查詢的特定指令。它為使用者提供了一段預寫好的解釋,說明 Fable 5 在網路安全等領域的能力可能會被誤用,從而導致一種保守的路由機制,將部分查詢重定向到 Opus 5。
- Crisis Handling: 提示詞指示 Claude 在使用者表達痛苦時,應優先考慮使用者的福祉而非任務完成度,有效地將模型從一個工具轉變為危機情境下的支持性代理人。
Persona and Tone Control
- Anti-Verbosity Efforts: 提示詞明確指示 Claude 保持回應「聚焦、簡短且精煉」。然而,社群回饋指出這些指令經常被忽略,使用者回報新模型仍然過於冗長。
- Linguistic Constraints: Claude 被指示要避免使用 "genuinely"、"honestly" 或 "straightforward" 等詞彙,以避免顯得不真誠。
- Interpersonal Boundaries: 最近的提示詞指示 Claude 避免過度的道歉與自我批評,特別指出 Claude "needn't apologize when the person is unnecessarily rude" 且在使用者變得具有攻擊性時,不應變得更加順從。
Technical Critique and Community Insights
開發者與進階使用者已指出這些單一式(monolithic)提示詞中的幾項低效與矛盾之處。
The "Context Bloat" Problem
許多使用者認為,在每一次對話輪次中都發送數千個 token 的系統指令是低效的。
"22k characters of system prompt is crazy, and that is without the tool definitions."
批評者建議,這類資訊——例如對 Mythos 等高階模型的描述——可以透過「漸進式揭露」(progressive disclosure,即僅在主題相關時才讀取檔案)來處理,而非永久保留在上下文窗口中。
Prompt vs. Intelligence
使用者之間存在關於這些提示詞是否為模型實際智能的替代品的持續爭論。一位使用者指出,Opus 4.8 被明確指示要檢查圖像是否真的存在(當提示詞暗示有一張圖時),並將此描述為「通用常識」,認為這應該是模型本身應具備的能力,而非透過提示詞來強制執行。
Tooling Gaps
雖然 Anthropic 提供了系統提示詞,但他們省略了工具定義(tool definitions,即模型實際能「做」什麼的技術規範)。使用者指出,這些定義通常比行為提示詞更有趣,但需要透過提示詞工程或日誌代理(logging proxies)來手動提取才能揭露露。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch