Anthropic Proposed AI Development Transparency Framework
Anthropic은 가장 강력한 AI 시스템 개발자들의 공공 안전과 책임성을 보장하기 위해 설계된 타겟형 투명성 프레임워크를 제안했습니다. 이 프레임워크는 정부, 학계 및 산업계에서 글로벌 안전 표준과 포괄적인 평가 방법을 개발하는 동안 과도기적 안전 조치를 제공하는 것을 목표로 합니다.
A Flexible Approach to AI Regulation
제안된 프레임워크는 국가 안보, 공공 이익 및 신약 개발과 같은 분야에서 AI 혁신을 방해하거나 혜택의 전달을 늦추는 것을 피하기 위해 가볍고 유연하게 설계되었습니다. Anthropic은 기술 변화의 빠른 속도로 인해 AI 평가 방법이 몇 달 안에 구식화되는 경우가 많기 때문에, 정부가 부과하는 경직된 표준은 역효과를 낼 수 있다고 주장합니다.
Minimum Standards for AI Transparency
Anthropic은 기술의 진화하는 특성을 수용하면서 보안 및 공공 안전을 강화하기 위해 AI 투명성 정책을 안내해야 할 6가지 핵심 원칙을 설명합니다:
1. Targeted Application to Large Developers
투명성 요구 사항은 가장 큰 프론티어 모델 개발자들에게만 적용되어야 합니다. 이러한 개발자들은 컴퓨팅 파워, 컴퓨팅 비용, 평가 성능, 연간 매출 및 R&D와 관련된 임계값에 의해 구분됩니다. 스타트업 생태계를 보호하기 위해 프레임워크는 소규모 개발자들에 대한 면제를 제안합니다. 잠재적인 임계값의 예로는 연간 매출 약 $100 million 또는 연간 R&D 및 자본 지출 약 $1 billion가 있습니다.
2. Implementation of Secure Development Frameworks
대상 개발자들은 "unreasonable risk"를 평가하고 완화하기 위한 Secure Development Framework를 구축해야 합니다. 이러한 위험은 특히 정렬되지 않은 모델 자율성으로 인한 피해와 화학, 생물학적, 방사능 및 핵(CBRN) 피해의 생성을 포함합니다.
3. Public Disclosure of Safety Frameworks
Secure Development Frameworks는 AI 기업이 유지 관리하는 공개 웹사이트에 공개되어야 하며, 민감한 정보에 대해서는 합리적인 편집이 허용됩니다. 기업들은 또한 자신들이 게시된 프레임워크의 조건을 준수하고 있다는 자기 인증을 제공해야 합니다.
4. Publication of System Cards
개발자들은 배포 시점에 system cards 또는 유사한 문서를 공개적으로 공개해야 합니다. 이 문서들은 테스트 절차, 평가 결과 및 완화 조치를 요약해야 하며, 모델이나 대중의 안전과 보안을 해칠 수 있는 정보에 대해서는 편집이 허용됩니다.
5. Legal Protections for Whistleblowers
책임성을 보장하기 위해, 프레임워크는 연구실이 자체 프레임워크 준수 여부에 대해 거짓말을 하는 것을 법적 위반으로 만드는 것을 제안합니다. 이는 기존의 내부 고발자 보호법을 적용할 수 있게 하고 집행을 의도적인 부정 행위에 초점을 맞추게 합니다.
6. Evolutionary Transparency Standards
AI 안전 및 보안 관행은 초기 단계에 있으므로, 프레임워크는 진화할 수 있도록 설계되어야 합니다. 요구 사항은 이해관계자들 사이에서 합의된 최선의 관행이 나타남에 따라 적응하는 유연하고 가벼운 표준으로 시작해야 합니다.
Industry Context and Policy Implications
이 제안은 Anthropic의 Responsible Scaling Policy 및 Google DeepMind, OpenAI, Microsoft와 같은 주요 연구실들이 채택한 기존의 자발적 관행과 일치합니다. 이러한 요구 사항을 법으로 성문화할 경우, 프레임워크는 산업계의 최선의 관행을을 표준화하고 모델이 더 강력해짐에 따라 안전성 공개가 철회될 수 없음을 보장할 것입니다.
Anthropic은 system cards 및 Secure Development Frameworks에 대한 이러한 투명성 요구 사항이 정책 입안자들에게 더 엄격한 규제가 필요한지 여지부를 결정할 데 필요한 증거를를 제공하는 동시에, 대중에게 프론티어 AI 기술에 대한 필수적인 정보를 제공할 것을 제안합니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch