Anthropic Crosscoder Model Diffing 研究
Anthropic 的可解釋性團隊分享了關於 Crosscoder Model Diffing 的初步研究。這項工作旨在為可解釋性領域的研究人員提供關於如何使用 crosscoders 來比較和區分不同 AI 模型的研究見解。
研究的初步性質
Anthropic 將其 Crosscoder Model Diffing 的工作結果描述為開發中的工作和初步實驗。團隊明確要求讀者將這些發現視為在實驗室會議背景下分享的早期階段研究,而非正式、成熟的研究論文。
在 Anthropic 研究組合中的背景
這項關於 Crosscoder Model Diffing 的公告是 Anthropic 更廣泛的研究更新的一部分,其中包括對多智能體系統中系統性失敗的研究、對員工重新培訓計劃的審查,以及 Claude 未發布研究版本在數學能力方面的進展,特別是關於 Riemann zeta function 的部分。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch