대규모 언어 모델의 확장 가능한 감독(Scalable Oversight)에 대한 진척도 측정

Anthropic은 인간의 능력을 초과하는 기술을 보유한 AI 시스템을 감독하는 과제인 확장 가능한 감독(scalable oversight)에 대한 진척도를 측정하기 위한 프레임워크를 도입했습니다. 이 연구는 안전하고 유용한 범용 AI를 개발하는 데 있어, 대부분의 작업 관련 기술에서 인간을 능가할 수 있는 시스템을 인간이 감독할 수 있는 방법이 필요하기 때문에 매우 중요합니다.

확장 가능한 감독의 과제

확장 가능한 감독은 특정 작업과 관련된 대부분의 기술에서 잠재적으로 인간을 능가하는 AI 시스템을 감독하는 문제를 의미합니다. 이를 경험적으로 연구하는 데 있어 주요 어려움은 현재의 범용 AI 시스템이 아직 모든 영역에서 인간의 능력을 광범위하게 초과하지는 못한다는 점입니다.

확장 가능한 감독을 위한 실험 설계

현재의 모델로 확장 가능한 감독을 연구하기 위해, Anthropic은 인간 전문가가 성공하지만, 도움을 받지 않는 인간과 현재의 범용 AI 시스템 모두 실패하는 작업에 초점을 맞춘 실험 설계를 제안합니다. 이 접근 방식은 연구자들이 인간 전문가를 정답(ground truth)으로 사용하여 정확성을 확인하는 동시에, 모델이 비전문가인 인간이 전문가 수준의 성능에 도달할 수 있도록 도울 수 있는지 테스트할 수 있게 합니다.

개념 증명 결과

Anthropic은 두 가지 질의응답 작업인 MMLU (Massive Multitask Language Understanding)와 시간 제한이 있는 QuALITY를 사용하여 개념 증명 실험을를 수행했습니다. 이 실험은 인간 참가자가 채팅을 통해 신뢰할 수 없는 대규모 언어 모델(LLM) 대화 어시스턴트와 상호작용하는 확장 가능한 감독의 기본 전략을 테스트했습니다.

이 실험의 주요 결과는 다음과 같습니다:

  • 인간 성능 향상: LLM 어시스턴트와 상호작용하는 인간 참가자들은 도움을 받지 않았을 때의 자신의 성능을 상당히 능가했습니다.
  • 시스템 성능 향상: 인간-AI 협업은 모델 단독으로 작동할 때보다 더 나은 성능을 보였습니다.
  • 연구의 실행 가능성: 결과는 모델이 신뢰할 수 없더라도 현재의 모델을 사용하여 확장 가능한 감독을 연구하는 것이 실행 가능하다는 것을 나타냅니다.

AI 안전에 대한 시사점

이러한 결과는 대규모 언어 모델이 어려운 작업을 수행하는 인간을 생산적으로 도울 수 있다는 최근의 증랜거를 뒷받침합니다. 연구자들은 인간이 복잡한 작업에서 자신의 성능을을 향상시키기 위해 LLM을 사용할 수 있음을 보여줌으로써, AI 시스템의 능력이 향상됨에 따라 인간이 AI 시스템에 대한 감독권을 유지할 수 있는 경로가 존재함을 시사합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch