OpenAI 데이터 파트너십
OpenAI는 조직과 협력하여 공개 및 비공개 데이터셋을 AI 모델 학습용으로 생산하도록 설계된 데이터 파트너십 프로그램을 도입했습니다. 이 이니셔티브는 학습 데이터의 폭을 늘려 AI 모델이 다양한 주제, 산업, 문화, 언어를 깊이 이해하도록 보장하는 것을 목표로 하며, OpenAI는これが 안전하고 유익한 인공 일반 지능(AGI)을 만드는 데 필수적이라고 말합니다.
데이터 획득 목표 및 요구사항
OpenAI는 인간 사회를 반영하고 현재 온라인에서 공개적으로 쉽게 접근할 수 없는 대규모 데이터셋을 찾고 있습니다. 이 프로그램은 연결되지 않은 스니펫보다는 장문의 글이나 대화와 같이 인간의 의도를 표현하는 데이터에 중점을 둡니다.
주요 기술 요구 사항 및 기능에는 다음과 같은 것이 포함됩니다:
- 멀티모달 지원: OpenAI는 텍스트, 이미지, 오디오, 비디오와 함께 작업할 수 있습니다.
- 데이터 디지털화: 회사는 파트너가 데이터를 디지털화하고 구조화하도록 돕기 위해 사내 AI 기술을 사용합니다. 여기에는 PDF용 세계 수준의 광학 문자 인식(OCR)과 spoken words를 전사하기 위한 자동 음성 인식(ASR)이 포함됩니다.
- 데이터 정제: OpenAI는 파트너 팀과 협력하여 데이터를 처리하고 자동 생성된 아티팩트나 전사 오류를 제거하는 것을 제공합니다.
- 제외 사항: 이 프로그램은 민감하거나 개인 정보를 포함하거나 제3자의 정보를 포함하는 데이터셋을 특별히 제외합니다.
파트너십 모델
조직은 두 가지 서로 다른 경로를 통해 OpenAI와 파트너십을 맺을 수 있습니다:
오픈소스 아카이브
이 경로는 AI 모델 학습에 누구나 사용할 수 있는 공개 오픈소스 데이터셋을 만들고자 하는 파트너를 위한 것입니다. OpenAI는 또한 이러한 데이터셋을 추가 오픈소스 모델 학습에 사용할 수도 있습니다.
비공개 데이터셋
이 경로는 특정 도메인에 대한 AI의 이해를 높이면서 데이터를 비공개로 유지하고자 하는 조직을 위한 것입니다. 이러한 데이터셋은 기초 모델, 파인튜닝 모델, 커스텀 모델을 포함한 독점 AI 모델 학습에 사용됩니다. OpenAI는 파트너가 선호하는 민감도와 접근 제어로 이 데이터를 처리할 것을 약속합니다.
실제 적용 사례 및 예시
OpenAI는 이미 특정 영역에서 모델 성능을 향상시키기 위해 이러한 파트너십을 구현했습니다:
- 언어 지원: OpenAI는 아이슬란드 정부 및 Miøeind ehf와 협력하여 curated 데이터셋을 통합하여 GPT-4의 아이슬란드어 구사 능력을 향상시켰습니다.
- 법률 이해: 비영리 단체 Free Law Project와의 파트너십을 통해 AI 학습에 대량의 법률 문서 컬렉션을 포함시켜 법률 이해에 대한 접근을 민주화하도록 설립되었습니다.
Sources
- OriginalOpenAI Data Partnerships