OpenAI Zelma: GPT-4를 통해 교육 데이터를 접근 가능하게 만들기

Zelma는 GPT-4 기반 연구 보조 도구로, 학부모, 교사, 학교 관리자 및 정책 입안자들이 3~8학년 학생들의 미국 표준화 시험 데이터를 접근하고 분석할 수 있게 합니다. 분산된 다양한 형식의 교육 데이터를 통합된 형식으로 변환하고 OpenAI API를 활용함으로써, Zelma는 사용자가 평이한 언어로 맞춤형 교육 인사이트를 얻을 수 있도록 합니다.

Zelma의 기술 구현

Zelma는 브라운 대학교의 Emily Oster 박사와 학생 연구원 팀에 의해 개발되었으며, 이들은 1년 동안 교육 데이터를 정리하고 통합하는 작업을 수행했습니다. 이 도구는 Novy와의 협업을 통해 다음과 같은 기술 구성 요소를 구현했습니다:

GPT-4와 함수 호출

Novy는 OpenAI의 함수 호출 기능을 활용하여 GPT-4가 사용자에게 정보를 표시하기 위한 적절한 시각화와 데이터 필드를 선택하도록 했습니다.

질의 제안을 위한 파인튜닝

‘질문하기’ 화면에서 사용자 경험을 향상시키기 위해, 팀은 모델을 파인튜닝하여 사용 가능한 데이터를 기반으로 질문을 제안하는 데이터 인식 자동완성 기능을 만들었습니다.

정확성을 위한 벡터 데이터베이스

신뢰할 수 있는 예시 그래프들을 임베딩하여 벡터 데이터베이스에 저장했습니다. 이 접근 방식은 어려운 경계 사례를 처리할 때 응답의 정확성을 향상시키는 데 사용되었습니다.

사용자 경험 및 범위 관리

사용자가 Zelma의 지식 범위 내에서 질문을 유지하고, 다양한 질문 표현 방식을 처리하기 위해 개발자들은 여러 설계 선택을 구현했습니다:

  • 예시 프롬프트 제안: Zelma가 특정 교육 데이터 분야에 특화되어 있기 때문에, 예시 프롬프트는 사용자가 어떻게 질의를 표현하고 도구가 어떤 답변을 제공할 수 있는지 안내합니다.
  • 공개 질문 로그: Zelma에 제시된 모든 질문은 공개되어, 사용자가 다른 질문으로부터 배울 수 있게 하고 관련 없는 질문을 억제합니다.
  • SQL 코드 투명성: Zelma는 답변을 생성하는 데 사용된 SQL 코드를 표시하여 사용자가 논리를 검증할 수 있게 합니다. 비기술 사용자에게는 동일한 논리를 평이한 언어로 설명합니다.
  • 맥락 설명: 이 도구는 정의를 제공하고 주 평가 변화와 같은 중요한 사건을 표시하여 사용자가 특정 연도의 데이터에 영향을 미쳤을 수 있는 외부 요인을 이해하도록 돕습니다.

Sources