lechmazur/writing
This benchmark tests how well LLMs incorporate a set of 10 mandatory story elements (characters, objects, core concepts, attributes, motivations, etc.) in a short creative story
解決的問題
本專案提供一個用於評估大型語言模型(LLMs)創造性寫作能力的基準。它超越了單純的自由形式寫作,測試模型在嚴格受限的創意簡報下,構建連貫且原創故事的能力。
作法
模型會收到包含十項必要元素(如角色、物件、概念、場景和語氣)的受限簡報。基準測試隨後採用成對比較方法:
- 故事生成:模型根據相同的固定簡報撰寫故事。
- 成對評估:獨立的評估模型閱讀成對的故事,並選擇哪一個較佳。
- 順序中性化:故事以兩種可能的順序呈現,以防止位置偏誤。
- 評分:將個別判斷合併為相對比較分數與勝率百分比,而非使用絕對分數。
- 驗證:系統使用橋接驗證方法,整合不同版本評估模型的證據。
適用對象
- 希望衡量 LLM 創造性寫作品質的 AI 研究人員與開發者。
- 對比較不同前沿模型敘事表現感興趣的使用者。
亮點
- 受限創造力:衡量特定情節元素的整合,而不僅是關鍵字的包含。
- 相對排名:採用一對一比較系統,生成模型表現排行榜。
- 全面資料:包含公開成果,如故事提示、生成文字與機器可讀的排行榜表格。
- 診斷工具:追蹤評估者一致性與字數合規性,確保基準測試的可靠性。
相關
- 專案
- 專案
- 專案
- 專案
- 專案