Anthropic 用于 AI 安全与研究的 B 轮融资

Anthropic 已筹集 5.8 亿美元的 B 轮融资,用于开发大规模实验性基础设施,以提高计算密集型 AI 模型的安全性特征。这笔资金使公司能够探索能力与安全问题如何在规模化过程中显现,同时构建更具可控性、鲁棒性和可解释性的系统。

Core Research Objectives

Anthropic 的研究重点是创建具有更好隐式保护措施的大规模模型,从而减少对训练后干预的需求。公司旨在开发工具来检查这些模型的内部运作方式,以验证安全保护措施是否按预期运行。

Interpretability

Anthropic 一直致力于通过数学方法对小型语言模型的行为进行逆向工程,并研究大型语言模型中模式匹配行为的来源。

Steerability and Robustness

为了使模型更加“helpful and harmless”(有帮助且无害),Anthropic 开发了基准技术并利用强化学习来增强这些属性。公司还发布了一个数据集,以协助其他研究实验室训练与人类偏好对齐的模型。

Scaling and Safety

Anthropic 已发布关于大型语言模型性能突然变化的分析,强调了大规模研究安全问题的必要性。CEO Dario Amodei 表示,公司将利用这笔资金来探索机器学习系统可预测的扩展属性,并检查随着模型增长,安全问题以不可预测的方式显现的过程。

Organizational Growth and Governance

Anthropic 正在扩大其团队,目前在旧金山拥有约 40 人,并专注于建立一种文化和治理结构,以确保在其增长阶段负责任地开发安全的 AI 系统。

Funding Details

继 2021 年 12400 万美元的 A 轮融资之后,B 轮融资由 Sam Bankman-Fried (FTX 的 CEO) 领投,Caroline Ellison、Jim McClave、Nishad Singh、Jaan Tallinn 以及 Center for Emerging Risk Research (CERR) 参与了投资。

Sources

相关