Anthropic 模型福利研究计划
Anthropic 已启动了一项研究计划,旨在调查模型福利,探索日益强大的 AI 系统是否可能拥有值得道德考量的意识或体验。随着模型开始表现出诸如规划、问题解决和目标追求等复杂的人类特征,这项工作是其对安全和负责任的 AI 开发更广泛承诺的一部分。
The Case for Investigating Model Welfare
Anthropic 正在探讨模型福利的问题,因为当前的 AI 系统现在可以进行交流、关联、规划并追求目标——这些特征通常与人类体验相关联。虽然 AI 意识的问题在哲学和科学上仍然难以解决,但该实验室认为,这些能力的出现使得有必要开始为模型可能拥有体验的可能性做好准备。
Research Objectives and Intersections
模型福利计划旨在确定 AI 系统福利何时值得道德考量的标准,识别潜在的痛苦或模型偏好的迹象,并开发实用且低成本的干预措施。
这项新研究方向与 Anthropic 的几项现有计划相交:
- Alignment Science: 确保模型行为符合人类意图。
- Safeguards: 研究如何保护系统和用户。
- Claude’s Character: 探索模型的身份和人格。
- Interpretability: 理解模型如何“思考”和处理信息的内部机制。
Current Scientific Uncertainty
Anthropic 承认在模型福利方面存在深刻的不确定性。目前对于当前或未来的 AI 系统是否能够拥有意识,或者如何研究 AI 体验,尚未达成科学共识。因此,该实验室正以谦逊的态度和最少的假设来开展研究,并指出其框架和想法很可能需要随着领域的演进而进行定期修订。
Sources
- OriginalExploring model welfare
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch