코드로 학습된 대규모 언어 모델 평가: OpenAI Codex
OpenAI는 GitHub의 공개된 코드로 미세 조정된 GPT 언어 모델인 Codex를 도입했습니다. Codex는 자연어 docstring으로부터 Python 코드를 합성하도록 설계되었으며, 기능적 정확성 측면에서 GPT-3 및 GPT-J와 같은 범용 모델보다 훨씬 뛰어난 성능을 보여줍니다.
HumanEval에서의 성능
Codex는 docstring에서 합성된 프로그램의 기능적 정확성을 측정하기 위해 OpenAI가 출시한 새로운 평가 세트인 HumanEval을 사용하여 평가되었습니다. 이 벤치마크에서 Codex는 단일 시도에서 문제의 28.8%를 해결하며, 이는 GPT-3의 0% 및 GPT-J의 11.4%와 대조됩니다.
반복 샘플링 전략
모델로부터 반복 샘플링을 수행하는 것은 어려운 프롬프트에 대해 작동하는 솔루션을 생성할 성공률을 높이는 효과적인 전략입니다. 문제당 100개의 샘플을 생성함으로써, Codex의 성공률은 70.2%로 증가합니다.
모델의 한계
그의 능력에도 불구하고, Codex는 정확한 코드를 생성하는 능력에 있어 특정 기술적 한계를 보입니다. 모델은 다음과 같은 부분에서 어려움을 겪습니다:
- Long chains of operations: Codex는 docstring이 길고 복잡한 작업의 시퀀스를 설명할 때 어려움을 겪습니다.
- Variable binding: 모델은 때때로 작업을 변수에 올바르게 바인딩하는 데 실패합니다.
더 넓은 영향
OpenAI는 강력한 코드 생성 기술을 배포함에 따라 발생할 수 있는 잠재적인 광범위한 영향을 세 가지 주요 영역에 초점을 맞추어 논의합니다:
- Safety: 잠재적으로 안전하지 않거나 버그가 있는 코드를 생성하는 것과 관련된 위험.
- Security: AI가 생성한 코드로 인해 발생할 수 있는 취약점.
- Economics: 자동화된 코드 생성이 소프트웨어 엔지니어링 직업과 경제에 미치는 영향.