lechmazur/writing
This benchmark tests how well LLMs incorporate a set of 10 mandatory story elements (characters, objects, core concepts, attributes, motivations, etc.) in a short creative story
解决的问题
该项目提供了一个用于评估大语言模型(LLMs)创造性写作能力的基准测试。它超越了简单的自由写作,测试模型在严格受限的创意简报下,构建连贯且原创故事的能力。
工作原理
模型会收到包含十个必需元素(如角色、物品、概念、场景和语气)的受限简报。基准测试随后采用成对比较方法:
- 故事生成:模型基于相同的固定简报撰写故事。
- 成对评估:独立的评估模型阅读成对的故事,并选择哪一个更优。
- 顺序中性化:故事以两种可能的顺序呈现,以防止位置偏差。
- 评分:将个体判断合并为相对比较分数和胜率百分比,而非使用绝对评分。
- 验证:系统使用桥接验证方法,整合不同版本评估模型的证据。
适用对象
- 希望衡量 LLM 创造性写作质量的 AI 研究人员和开发者。
- 对比较不同前沿模型叙事性能感兴趣的用户。
亮点
- 受限创造力:衡量特定情节元素的整合,而不仅仅是关键词的包含。
- 相对排名:采用一对一比较系统,生成模型性能排行榜。
- 全面数据:包含公开的成果,如故事提示、生成文本和机器可读的排行榜表格。
- 诊断工具:追踪评估者一致性与字数合规性,确保基准测试的可靠性。
相关
- 项目
- 项目
- 项目
- 项目
- 项目