lechmazur/writing
This benchmark tests how well LLMs incorporate a set of 10 mandatory story elements (characters, objects, core concepts, attributes, motivations, etc.) in a short creative story
해결하는 문제
이 프로젝트는 대규모 언어 모델(LLMs)의 창의적 이야기 작성 능력을 평가하는 벤치마크를 제공합니다. 단순한 자유 형식의 글쓰기를 넘어서, 모델이 엄격한 제약 조건이 있는 창의적 브리프에 따라 일관성 있고 독창적인 이야기를 구성할 수 있는지 테스트합니다.
작동 방식
모델은 캐릭터, 물건, 개념, 설정, 톤 등 10가지 필수 요소를 포함한 제약 조건이 있는 브리프를 받습니다. 이후 페어와이즈 비교 방식을 사용합니다:
- 이야기 생성: 모델은 동일한 고정된 브리프를 기반으로 이야기를 작성합니다.
- 페어와이즈 평가: 별도의 평가 모델이 짝지어진 이야기 쌍을 읽고 어느 쪽이 더 나은지 선택합니다.
- 순서 중립화: 이야기는 두 가지 가능한 순서로 제시되어 위치 편향을 방지합니다.
- 점수 부여: 개별 판단을 상대적 비교 점수와 승률 백분율로 통합하며, 절대 평가가 아닌 상대 평가를 사용합니다.
- 검증: 시스템은 브리지 검증을 통해 다양한 평가 모델 버전 간의 증거를 결합합니다.
대상 사용자
- LLM의 창의적 글쓰기 품질을 측정하고자 하는 AI 연구자 및 개발자.
- 다양한 최전방 모델의 서사 성능을 비교하고자 하는 사용자.
주요 특징
- 제약된 창의성: 키워드 포함이 아니라 특정 플롯 요소의 통합을 측정합니다.
- 상대 순위: 헤드투헤드 비교 시스템을 통해 모델 성능 순위표를 생성합니다.
- 포괄적인 데이터: 이야기 프롬프트, 생성된 텍스트, 기계 판독 가능한 순위표 등 공개 자산을 포함합니다.
- 진단 도구: 평가자 간 일치도와 단어 수 준수 여부를 추적하여 벤치마크 신뢰성을 보장합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트