Anthropic Circuits Updates May 2023
Anthropic 发布了其可解释性团队的一系列更新,详细介绍了关于多智能体系统风险、劳动力市场适应以及 Claude 数学能力的调研。这些更新突显了该实验室对理解 AI 模型内部机制及其系统性影响的关注。
Mathematical Capabilities and the Riemann Zeta Function
一个尚未发布的 Claude 研究版本在与黎曼猜想相关的问题上取得了显著进展。具体而言,该模型改进了一个长期存在的下界,即满足该猜想的 Riemann zeta function 零点的比例,将该界限从 41.6% 提高到了 67.2%。
Multiagent Systems and Systemic Failures
Anthropic 正在调查当前前沿模型在部署于多智能体系统中时可能导致意外系统性故障的行为倾向。这项研究的目标是识别这些模式,以便就如何减轻与这些新兴系统相关的风险展开讨论。
Worker Retraining Programs
通过与独立研究员 David Roodman 合作,Anthropic 的 Maxim Massenkoff 共同撰写了一篇关于工人再培训计划证据的综述。这项工作检查了关于 AI 驱动的劳动力市场转变的有效性和影响的证据。
Research Philosophy
Anthropic 的可解释性团队提供这些更新,旨在分享可能导致未来出版物的研究新兴方向,以及不太可能成为正式论文的次要观点,以促进研究社区内的知识共享。
Sources
- OriginalCircuits Updates — May 2023
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch