OpenAI Scholars 2019 최종 프로젝트
OpenAI는 2019 OpenAI Scholars 프로그램의 최종 프로젝트를 선보이며, 다양한 학문 및 전문 배경을 가진 개인들이 딥러닝과 강화학습을 적용하여 복잡한 문제를 해결하는 방법을 보여주었습니다. 이러한 프로젝트는 자연어 처리, 로봇 조작, 의료 치료 최적화, 모델 해석 가능성을 포괄합니다.
자연어 처리 및 이해
여러 학자들은 특정 작업에 트랜스포머 기반 언어 모델의 적용과 최적화에 중점을 두었습니다.
GPT-2를 이용한 질문 answering 미세 조정
Fatma Tarlaci는 질문 answering(QA) 작업을 위해 GPT-2 소형 모델을 미세 조정하는 실험을 진행했습니다. 이 프로젝트는 QA가 언어 처리와 추론 기술의 조합을 필요로 하기 때문에 모델의 추론 메커니즘을 분석하는 것을 목표로 했습니다.
트랜스포머를 위한 지식 증류
Edgar Barraza는 모바일 장치에서 강력한 트랜스포머 언어 모델을 더 접근 가능하게 만들기 위해 지식 증류를 탐구했습니다. 이 프로젝트는 대형이고 잘 훈련된 트랜스포머를 "교사"로 사용하여 작은 규모의 훈련되지 않은 "학생" 네트워크를 훈련시켰으며, 상당한 능력을 희생하지 않고 모델 크기를 줄였습니다.
강화 학습을 통한 감정 분석
Helen (Mengxin) Ji는 문장 감정을 예측하기 위해 강화 학습(RL)과 지도 NLP 방법을 결합한 모델을 제안했습니다. 결과는 RL 방법을 추가하면 트랜스포머 모델보다 성능을 향상시키고 사전 훈련된 BERT 모델과 비교 가능한 결과를 낼 수 있음을 나타내며, 분류 문제에서 RL 훈련에 잘 정의된 보상 함수가 중요함을 강조했습니다.
강화 학습 및 로봇공학
이 코호트의 연구는 희소 보상 문제를 해결하고 의사결정 과정을 최적화하는 데 중점을 두었습니다.
호기심 기반 로봇 조작
Jonathan Michaux는 내재적 동기—구체적으로 호기심 기반 탐색—to 사용해 외재적 보상이 희소하거나 누락된 로봇 작업을 해결했습니다. 에이전트가 현재 상태와 행동으로부터 다음 상태를 예측하는 능력의 오류를 내재적 보상으로 공식화함으로써, 이 프로젝트는 시뮬레이션에서 여러 어려운 로봇 조작 작업을 성공적으로 해결했습니다.
의료 치료 최적화
Elynn Chen은 과거 전자 건강 기록(EHR)을 사용하여 최적의 치료 요법을 권장하는 시스템을 개발했습니다. 구체적으로는 정맥 주사액과 혈관수축제의 용량을 권장했습니다. 정책 반복과 테이블형 Q-learning을 사용하여, 최적의 RL 정책이 실제 의사 치료보다 정맥 주사액의 용량을 낮추고 혈관수축제의 용량을 높이는 것을 권장하는 것으로 나타났습니다. 오프 정책 평가는 Q-learning이 정책 반복보다 더 높은 보상을 제공함을 나타냈습니다.
DQN에서의 할인 인자 분석
Yuhao Wan은 Deep Q-Networks(DQN)에서 할인 인자(gamma)의 역할을 조사했습니다. 이 프로젝트는 할인 인자가 시차적 선호와 부트스트래핑에 대한 신뢰를 모두 인코딩한다는 것을 밝혀냈습니다. 이로 인해 맞춤형 Gridworld 환경에서 기본 성능을 향상시키는 "근시안적 스킴"이 개발되었고, DQN 프레임워크를 넘어 더 일반적인 환경에서도 robustness를 입증했습니다.
모델 해석 가능성과 교육적 응용
두 프로젝트는 신경망의 투명성과 교육에서 ML의 실제 적용에 중점을 두었습니다.
Activation Atlases를 사용한 GAN 시각화
Janet Brown은 이미지 합성 생성적 적대 네트워크(GAN)를 평가하고 이해하기 위해 Activation Atlases 기법을 사용했습니다. 이 접근 방식은 실제 이미지와 가짜 이미지 사이의 차이를 수치적 및 altamente 시각적인 측면에서 측정할 수 있게 해주어, 신경망이 인식하는 "블랙 박스"를 들여다볼 수 있는 창을 제공했습니다.
교육을 위한 자동 프로젝트 라벨링
Nancy Otero는 교사가 온라인 프로젝트에 라벨을 붙일 수 있도록 설계된 개념 증명 모델인 CREATURE를 개발했습니다. 프로젝트 기반 학습은 효과적이지만 적절히 라벨이 지정된 프로젝트를 찾는 것은 어렵기 때문에, CREATURE는 온라인 프로젝트에 75~90%의 정확도로 라벨을 붙이는 솔루션을 제공합니다.