소통을 배우다: OpenAI의 2017년 출현하는 AI 언어 연구

개요

OpenAI의 2017년 '소통을 배우다' 연구는 협업 목표에 대한 보상을 받을 때 강화 학습 에이전트가 기초가 되고 구성적인 언어를 발명할 수 있음을 보여준다.

훈련 설정

에이전트들은 간단한 랜드마크가 있는 2차원 세계에 배치되며, 다른 에이전트와 소통함으로써 가장 잘 달성할 수 있는 개별 목표가 주어진다. 각 에이전트는 각 시간 단계에서 그룹에 메시지를 브로드캐스트할 수 있으며, 모든 에이전트의 보상 합과 동일한 보상을 받아 협업을 장려한다. 에이전트는 환경 행동(이동 또는 보기)과 통신 행동(단어와 유사한 기호 브로드캐스트) 사이에서 선택한다. 이전 통신과 모든 엔티티의 위치를 관찰하고, 관찰된 메시지를 개인 순환 신경망에 저장한다.

emergent 언어 속성

결과 언어는 기초가 되고 구성적이다. 기초적이라는 것은 각 단어가 에이전트가 환경에서 직접 경험하는 무언가와 연결되어 있음을 의미한다. 예를 들어, 기호를 랜드마크 또는 다른 에이전트와 연관시키는 것이다. 구성적이라는 것은 에이전트가 특정 아이디어를 나타내는 메시지를 만들기 위해 여러 단어를 결합할 수 있음을 의미한다. 예를 들어, 다른 에이전트에게 특정 위치로 이동하도록 지시하는 것이다.

도전 과제 극복

초기 실험에서는 해석을 방해하는 개성적인 통신 패턴이 생성되었다. 먼저, 에이전트는 공백과 함께 하나의 발언을 반복하는 경향이 있었는데, 이는 모스 부호와 유사한 비구성적 언어를 만들었다. 발언당 작은 비용을 추가하고 빠른 작업 완료를 선호함으로써 간결한 사용과 더 큰 어휘를 장려했다. 둘째, 큰 어휘를 주었을 때 에이전트는 때때로 전체 문장을 하나의 단어로 인코딩했는데, 이는 어휘의 지수적 증가를 필요로 했다. 이는 자주 사용되는 단어의 사용에 보상을 주어 이를 억제하고 kompact 어휘를 촉진했다. 셋째, 에이전트는 inicialmente 전역 좌표계에 의존하는 “가장 위쪽” 또는 “가장 왼쪽”과 같은 공간적 용어로 랜드마크를 언급했는데, 자아 중심 프레임으로 전환함으로써 이러한 방향을 제거하고 에이전트가 랜드마크를 색상 속성으로 참조하도록 이끌었다.

비언어적 소통

같은 훈련 프레임워크는 에이전트가 텍스트 메시지를 교환할 수 없을 때도 작동한다. 그러한 환경에서 에이전트는 목표를 향해 눈먼 동료를 가리키거나 안내하거나 밀고 가는 것과 같은 신체적 행동을 즉흥적으로 수행한다. 이는 동반 애니메이션에 표시되어 있다.

기초적 언어 vs 상징적 언어

대규모 텍스트 코퍼스에서 언어 모델을 훈련시키는 접근 방식과는 달리, 이 방법은 세계와의 직접적인 연결이 부족하고 중국 방 사고 실험을 닮은 반면, 이 방법은 에이전트의 지각 경험에 언어를 기초시켜 단어가 현실과 어떻게 관련되는지를 더 깊이 이해하려고 한다.

미래 방향

팀은 에이전트가 사용할 수 있는 환경의 복잡성과 행동 범위를 늘려 기본 동사와 명사를 넘어 더 표현력 있는 언어를 조성할 계획이다. 발명된 언어가 풍부해질수록 인간의 해석이 어려워지므로, 향후 프로젝트는 에이전트가 영어 사용 파트너와 소통하도록 하여 emergent 언어를 영어와 연결함으로써 번역을 자동화할 것이다. 이 interdisciplinary 노력은 UC 버클리 연구자들과의 협력을 포함하며, 더 스마트한 언어 모델에 관심 있는 사람들은 OpenAI에서의 경력을 고려하도록 초대한다.

더 많은 정보

초기 결과는 동반된 arXiv 프리프린트에 설명되어 있다.

Sources