Anthropic Crosscoder Model Diffing 研究

Anthropic 的可解释性团队分享了关于 Crosscoder Model Diffing 的初步研究。这项工作旨在为可解释性领域的研究人员提供关于如何使用 crosscoders 来比较和区分不同 AI 模型的见解。

研究的初步性质

Anthropic 将其 Crosscoder Model Diffing 的工作结果描述为开发中的工作和初步实验。该团队明确要求读者将这些发现视为在实验室会议背景下分享的早期阶段研究,而非正式、成熟的研究论文。

在 Anthropic 研究组合中的背景

关于 Crosscoder Model Diffing 的公告是 Anthropic 更广泛的一系列研究更新的一部分,其中包括对多智能体系统中系统性故障的研究、对员工再培训计划的审查,以及对尚未发布的 Claude 研究版本在数学能力方面的进展,特别是关于 Riemann zeta 函数的研究。

Sources

相关