인공지능을 위한 신뢰 구축 조치
OpenAI와 버클리 리스크 앤드 시큐리티 랩은 foundation models이 국제 보안에 초래하는 위험을 완화하기 위해 설계된 신뢰 구축 조치(CBMs)를 상세히 설명하는 워크숍 논의를 발표했습니다. 이러한 조치는 적대감을 줄이고, 갈등의 escalation을 방지하며, 전 세계 이해관계자 간의 신뢰를 구축하여 사고나 의도하지 않은 갈등을 피하는 것을 목표로 합니다.
foundation models의 국제 보안 위험
foundation models은 국가 안보를 약화시킬 수 있는 여러 경로를 도입합니다. 식별된 주요 위험은 다음과 같습니다:
- 사고 및 의도하지 않은 확대: AI 기반 오류가 의도하지 않은 갈등을 초래할 가능성.
- 의도하지 않은 갈등: AI 능력이나 의도의 오해에서 발생하는 위험.
- 무기 확산: AI 능력에 의해 촉진된 무기 확산.
- 외교적 간섭: AI 시스템에 의한 인간 외교의 간섭.
제안된 신뢰 구축 조치(CBMs)
냉전 시대에서 기원한 신뢰 구축 조치는 적대감을 줄이고 신뢰를 향상시키는 유연한 수단입니다. 워크숍 참가자들은 foundation models에 직접 적용되는 여섯 가지 구체적인 CBMs를 식별했습니다:
- 위기 핫라인: 긴급 보안 문제를 관리하기 위한 직접적인 소통 채널 구축.
- 사고 공유: AI 관련 보안 사고에 대한 정보를 보고하고 공유하는 과정.
- 모델, 투명성, 시스템 카드: 표준화된 문서를 활용하여 모델의 능력과 한계에 대한 명확성을 제공.
- 콘텐츠 출처 및 워터마크: 콘텐츠의 출처를 확인하고 허위 정보를 방지하기 위한 기술적 마커 구현.
- 협력적 레드 팀링 및 테이블탑 연습: 모델의 취약점을 식별하기 위한 공동 스트레스 테스트에 참여.
- 데이터셋 및 평가 공유: 모델의 안전성과 성능을 평가하는 데 사용되는 데이터 및 벤치마크 공유.
구현 및 이해관계자 참여
foundation model 개발자의 대부분이 비정부_entity이기 때문에, 이러한 CBMs의 구현은 국가 간 합의에만 의존할 수 없습니다. 대신, 이러한 조치는 AI 랩과 정부 행위자를 포함한 더 넓은 이해관계자 커뮤니티를 포괄해야 합니다. 이러한 CBMs는 AI 랩 자체 또는 관련 정부 기관에 의해 구현될 수 있어 안정적이고 안전한 국제 환경을 보장할 수 있습니다.