OpenAI의 데이터 및 AI 접근 방식
Media Manager와 크리에이터 제어
OpenAI는 콘텐츠 소유자가 AI 훈련에 대한 선호도를 표현할 수 있도록 확장 가능한 솔루션인 Media Manager를 구축하고 있습니다. OpenAI는 이전에 웹 크롤러 권한(robots.txt 표준과 유사)을 활용해 출판사가 훈련에서 탈퇴하도록 허용하는 방식을 선도했지만, 많은 크리에이터가 자신의 콘텐츠가 호스팅된 웹사이트를 제어하지 못하기 때문에 이러한 신호가 불완전하다는 점을 인정합니다.
- Timeline: 목표는 2025년까지 도구를 구현하는 것입니다.
- Technical Requirement: 도구 개발에는 여러 출처에서 저작권이 있는 텍스트, 이미지, 오디오 및 비디오를 식별하기 위한 최첨단 머신러닝 연구가 필요합니다.
- Objective: OpenAI는 Media Manager가 크리에이터가 AI 시스템과의 콘텐츠 관계를 관리하는 산업 표준을 설정하기를 기대합니다.
데이터 소싱 및 모델 훈련
OpenAI는 모델의 지식, 이해 및 언어 능력을 향상시키기 위해 규모와 다양성이 증가하는 데이터셋을 사용해 기초 모델의 각 새로운 세대를 처음부터 훈련합니다. 회사는 세 가지 주요 데이터 범주에 의존합니다:
- Publicly Available Data: 여기에는 업계 표준 머신러닝 데이터셋 및 웹 크롤이 포함됩니다. OpenAI는 유료 장벽이 있는 소스, 주로 개인 식별 정보(PII)를 집계하는 소스, 회사 정책을 위반하는 소스, 혹은 명시적으로 탈퇴한 소스를 제외합니다.
- Proprietary Data Partnerships: OpenAI는 비공개 콘텐츠(예: 아카이브 및 메타데이터)에 접근하기 위해 파트너십을 맺습니다. 예시로는 Sora 훈련을 위한 비공개 비디오 라이브러리와 아이슬란드 정부와의 협력을 통해 토착 언어를 보존하는 프로젝트가 있습니다. OpenAI는 이미 순수하게 공개된 정보에 대해 유료 파트너십을 추구하지 않는다고 밝힙니다.
- Human Feedback: 모델은 AI 트레이너, 레드팀, 직원, 그리고 데이터 제어 설정을 통해 모델 개선에 동의한 사용자들의 피드백을 활용해 정제됩니다.
출판사 파트너십 및 발견
‘주의 경제’에서 크리에이터에게 권한을 부여하는 모델로 전환하기 위해, OpenAI는 출판사 콘텐츠를 자사 제품에 직접 통합하여 사용자와 원본 소스 간의 가시성과 연결성을 높이고 있습니다.
- Source Attribution: ChatGPT는 소스 링크를 개선하기 위한 업데이트를 받아 사용자가 더 나은 맥락을 얻고 출판사가 청중과 연결되는 새로운 방식을 제공합니다.
- Strategic Partnerships: OpenAI는 Financial Times, Le Monde, Prisa Media, Axel Springer 등 전 세계 뉴스 조직과 파트너십을 맺어 해당 콘텐츠를 ChatGPT에 표시하고 뉴스룸에 제공되는 도구를 향상시켰습니다.
- Educational Partnerships: Khan Academy와 ExamSolutions와의 협업을 통해 모델의 수학 성능을 향상시켜 개인화된 AI 튜터링을 확대했습니다.
데이터 프라이버시 및 사용 정책
OpenAI는 프라이버시와 비즈니스 기밀을 보호하기 위해 훈련에 사용되는 데이터에 대해 구체적인 경계를 유지합니다:
- Business Data: OpenAI는 ChatGPT Team, ChatGPT Enterprise, API Platform의 데이터를 훈련에 사용하지 않습니다.
- User Control: ChatGPT Free 및 Plus 사용자는 계정 설정을 통해 자신의 데이터가 향후 모델 개선에 기여하는지를 관리할 수 있습니다.
- Sensitive Information: 회사는 개인 및 민감한 정보의 처리를 줄이기 위한 기술을 적용하고, 개인에 대한 사적 또는 민감한 데이터를 제공하지 않도록 모델을 특별히 훈련합니다.
Sources
- OriginalOur approach to data and AI