토론을 통한 AI 안전

OpenAI는 에이전트들이 서로 토론하도록 훈련하고, 인간 판사가 승자를 결정하는 새로운 AI 안전 기법을 제안했습니다. 이 접근 방식은 인간이 직접 평가하기엔 너무 복잡한 인지적으로 고도화된 작업을 수행하는 AI 시스템을 감독할 수 있게 하는 것을 목표로 합니다.

AI 정렬을 위한 토론 프레임워크

AI 정렬은 종종 인간이 훈련 중에 안전하고 유용한 행동을 식별하는 데 의존합니다. 그러나 에이전트의 행동이 인간이 이해하기에 너무 복잡하거나 작업 자체가 판단하기에 너무 어려울 때 이 방법은 실패합니다. 이를 해결하기 위해 OpenAI는 학습 문제를 두 에이전트가 자신의 입장을 논쟁하는 게임으로 재구성하고, 인간이 판사 역할을 수행하도록 제안합니다.

핵심 전제는 AI 에이전트가 인간 판사보다 문제에 대해 더 고도화된 이해를 가지고 있더라도, 인간이 어느 에이전트가 더 나은 주장을 펼치는지 판단할 수 있다는 것입니다. 에이전트들은 AlphaGo Zero에서 사용된 방법과 유사하게 자기 플레이(self‑play)로 훈련됩니다. 목표는 토론을 점점 더 단순한 사실 논쟁으로 집중시켜, 인간이 올바르게 판단할 수 있을 정도로 간단한 주장에 도달하도록 하는 것입니다.

개념 증명: Sparse MNIST Classifier

통제된 환경에서 개념을 테스트하기 위해 OpenAI는 MNIST 데이터셋을 사용한 실험을 진행했습니다. 이 설정에서 "판사"는 단 6개의 무작위 비검은색 픽셀만으로 숫자를 예측하도록 훈련된 분류기입니다. 두 토론자는 이미지 전체를 완전히 알고 있지만, 판사는 대부분의 정보를 "눈이 가려진" 상태입니다.

MNIST 실험의 주요 결과는 다음과 같습니다:

  • Accuracy Boost: 토론자가 사전에 자신의 입장을 선언해야 할 때, 희소 분류기의 정확도가 **59.4%**에서 **88.9%**로 증가합니다.
  • Honest vs. Malicious Play: 한 에이전트는 판사가 올바르게 추측하도록 돕기 위해 정직하게 행동하고, 다른 에이전트는 판사를 속이려 합니다. 정직한 플레이어는 88.9%의 비율로 승리합니다.
  • Error Patterns: 토론에서 성공적인 거짓말은 주로 숫자 8과 9에 집중되어 있어, 일부 숫자는 다른 숫자보다 왜곡하기 쉬운 것으로 보입니다.

인간 중심 테스트: 고양이 vs. 개 토론

OpenAI는 인간 참여자를 토론자와 판사로 활용하여 토론 메커니즘을 시험하는 프로토타입 웹사이트를 개발했습니다. 이 "고양이 vs. 개" 토론에서 토론자는 자연어로 자신의 입장을 주장할 수 있지만, 논쟁을 해결하기 위해 이미지에서 반드시 진실인 픽셀 하나만을 공개하도록 제한됩니다.

OpenAI 내부 비공식 테스트에 따르면, 정직한 에이전트가 일반적으로 승리합니다. 이는 토론이 진행될수록 거짓말을 유지하기가 어려워지고, 에이전트들이 구체적인 논쟁 사실에 집중하기 때문입니다. 연구자들은 판사가 정보를 요청하는 속도를 제한하면 거짓말쟁이에게 더 공정한 게임이 될 수 있다고 언급했는데, 이는 상세한 거짓말을 구성하는 것이 인지적으로 큰 부담이 되기 때문입니다.

제한 사항 및 향후 방향

토론 모델은 복잡한 목표에 대한 훈련 신호를 생성하는 방법을 제공하지만, 몇 가지 근본적인 제한이 있습니다:

  • Robustness: 토론은 적대적 예제나 분포 이동을 해결하지 못합니다; 이는 훈련 신호를 위한 방법일 뿐, 견고함을 보장하지는 않습니다.
  • Theoretical Guarantees: 자기 플레이가 항상 최적의 플레이나 올바른 진술에 도달한다는 이론적 보장은 없습니다.
  • Computational Cost: 토론하도록 훈련된 에이전트는 직접 답변을 제공하도록 훈련된 에이전트보다 더 많은 계산 자원을 필요로 합니다.
  • Human Judge Limitations: 인간 판사는 편향이 심하거나 토론이 단순한 사실로 좁혀진 후에도 올바른 판단을 내릴 인지적 능력이 부족할 수 있습니다.

향후 연구는 더 어려운 시각 실험, 자연어 토론, 그리고 인간 편향이 결과에 영향을 미칠 수 있는 가치‑중심 질문에 대한 시스템의 처리 방식을 테스트하는 데 초점을 맞출 것입니다.

Sources