OpenAI AI 및 효율성 분석

OpenAI는 이미지넷 분류에서 특정 성능 수준에 도달하기 위해 신경망을 훈련하는 데 필요한 컴퓨팅 양이 2012년 이후 16개월마다 절반으로 줄어들었다는 것을 보여주는 분석을 발표했습니다. 이 추세는 알고리즘적 진보가 클래식한 하드웨어 개선 alone보다 더 큰 효율성 향상을 제공하고 있음을 나타냅니다.

알고리즘 효율성 동향

알고리즘 효율성은 특정 능력을 훈련하는 데 필요한 컴퓨팅 양의 감소로 정의됩니다. 성능을 일정하게 유지한 채, OpenAI는 여러 분야에서 최첨단(SOTA) 결과를 달성하는 데 필요한 자원이 크게 줄어든 것을 관찰했습니다:

  • ImageNet Classification: 현재는 2012년에 비해 AlexNet 수준의 신경망을 훈련하는 데 44배 적은 컴퓨팅이 필요합니다. ResNet-50 수준의 성능에 대해 효율성의 두 배 시간은 약 17개월입니다.
  • Machine Translation: Transformer 아키텍처는 영어-프랑스어 번역(WMT’14)에서 seq2seq 성능을 3년 후에 61배 적은 훈련 컴퓨팅으로 뛰어넘었습니다.
  • Game AI: AlphaZero는 1년 안에 AlphaGoZero 수준의 성능에 도달하기 위해 8배 적은 컴퓨팅이 필요하다고 추정됩니다. OpenAI Five Rerun은 원래 OpenAI Five를 세 달 안에 앞지르기 위해 5배 적은 훈련 컴퓨팅이 필요했습니다.

OpenAI는 이 진보를 "틱 토크" 모델이라고 설명합니다: 새로운 기능(틱)은 종종 massive한 컴퓨팅 지출을 필요로 하며, 이어서 개선된 버전(토크)은 프로세스 개선을 통해 배포 시 훨씬 더 효율적이 됩니다.

하드웨어 효율성과 비교

무어의 법칙은 달러당 flop이 2년마다 두 배로 증가한다고 일관되게 제시하지만, 관찰된 알고리즘적 향상이これを 초과했습니다. 구체적으로, AlexNet 성능 벤치마크에 대해 44배의 컴퓨팅 효율 향상은 같은 기간 동안 무어의 법칙이 제공할 수 있는 11배 향상을 초과합니다.

OpenAI는 하드웨어와 알고리즘적 효율성 향상이 곱셈적이라고 지적합니다. AI 발전에 대한 포괄적인 모델은 시간이 지남에 따라 AI 기능을 배포하는 비용을 정확히 예측하기 위해 두 가지를 모두 통합해야 합니다.

AI 진행의 기타 지표

훈련 효율성 외에도, OpenAI는 알고리즘적 진행의 몇 가지 다른 중요한 측면을 식별합니다:

  • 샘플 효율성: 저데이터 환경에서의 작업에 필수적입니다.
  • 훈련 속도: 학습 능력의 병렬화 가능성을 측정하는 지표입니다.
  • 추론 효율성: GPU 시간, 매개변수, flops로 측정됩니다. 예를 들어, ShuffleNet은 5년 동안 AlexNet 수준의 성능을 달성하면서 추론 효율성을 18배 향상시켰습니다(15개월 두 배 시간).
  • 달러 단위의 훈련 비용: 관련이 있지만, 이는 알고리즘적 진행뿐만 아니라 하드웨어 활용 및 클라우드 인프라의 영향도 받습니다.

분석의 제한 및 범위

OpenAI는 이 연구에서 몇 가지 제한 사항을 인정합니다:

  • 데이터 희소성: 분석은 몇 가지 작업에 대한 소수의 데이터 포인트에 기반하여, 이러한 추세가 모든 AI 작업에 일반화되는지 불분명합니다.
  • 최종 실행에 초점: 분석은 최적화된 모델의 최종 훈련 실행 비용을 측정하며, 아키텍처 탐색과 하이퍼파라미터 튜닝을 포함한 총 개발 비용은 포함하지 않습니다.
  • 개념적 진행: 능력의 첫 창출은 이후 효율성 증가보다 개념적 진행의 더 큰 부분을 차지한다고 간주됩니다.
  • 외삽 없음: 이 보고서는 이러한 추세의 장기 외삽에 대한 추측 없이 결과를 제시합니다.

AI 정책에 대한 시사점

OpenAI는 측정 및 평가를 중시함으로써 AI 정책 수립을 개선할 수 있다고 제안합니다. 구체적으로, 분석은 정책 입안자들이 다음을 해야 함을 나타냅니다:

  1. 학술 컴퓨팅 자원에 대한 자금 증대를 통해 학술 연구가 산업 연구를 복제하고 확장할 수 있도록 해야 합니다.
  2. 효율성 향상률을 평가하여 시간이 지남에 따라 AI 기능의 비용과 배포에 대한 정확한 직관을 개발해야 합니다.

Sources