Anthropic 可解釋性研究概覽
Anthropic 的可解釋性團隊致力於發現並理解大型語言模型 (LLMs) 的內部機制,以確保 AI 安全並推動正面結果。透過詳細解釋模型行為,該團隊旨在解決關鍵的安全問題,包括偏見、誤用和自主有害行為。
以內部模型理解作為安全的基礎
理解神經網路的內部狀態對於推理其安全性至關重要。Anthropic 的方法專注於解釋大型語言模型的特定行為,以超越黑箱運作,讓研究人員能夠解決與偏見和防止自主有害行為相關的問題。
多學科研究方法
Anthropic 雇用了一支由機器學習、天文學、物理學、數學、生物學和數據視覺化背景的研究人員組成的多學科團隊。該團隊包括該領域的關鍵人物,例如對 scaling laws 論文做出貢獻的人士,以及被認為開創了機械可解釋性 (mechanistic interpretability) 的研究人員。
關鍵研究領域與出版物
Anthropic 已發布了一項研究軌跡,專注於模型內部的各個面向,包括:
- 認知架構: 對語言模型中「全域工作空間」(global workspace) 的研究 (July 2026)。
- 內部狀態的文本化: 開發 Natural Language Autoencoders 以將模型的「想法」轉化為文本 (May 2026)。
- 情緒與人格: 對情緒概念及其功能的研究 (April 2026),以及用於監控和控制性格特徵的人格向量 (persona vectors) (August 2025)。
- 模型比較與穩定性: 建立一個「diff」工具以尋找新模型中的行為差異 (March 2026),以及研究用於穩定模型性格的助手軸 (assistant axis) (January 2026)。
- 內省與追蹤: 對 LLMs 中內省跡象的研究 (October 2025) 以及用於追蹤大型語言模型想法的工具 (March 2025)。
- 工具與審計: 開源電路追蹤工具 (May 2025) 以及審計語言模型是否存在隱藏目標 (March 2025)。
Sources
- OriginalInterpretability Research
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch