lechmazur/writing

This benchmark tests how well LLMs incorporate a set of 10 mandatory story elements (characters, objects, core concepts, attributes, motivations, etc.) in a short creative story

解決的問題

本專案提供一個用於評估大型語言模型(LLMs)創造性寫作能力的基準。它超越了單純的自由形式寫作,測試模型在嚴格受限的創意簡報下,構建連貫且原創故事的能力。

作法

模型會收到包含十項必要元素(如角色、物件、概念、場景和語氣)的受限簡報。基準測試隨後採用成對比較方法:

  1. 故事生成:模型根據相同的固定簡報撰寫故事。
  2. 成對評估:獨立的評估模型閱讀成對的故事,並選擇哪一個較佳。
  3. 順序中性化:故事以兩種可能的順序呈現,以防止位置偏誤。
  4. 評分:將個別判斷合併為相對比較分數與勝率百分比,而非使用絕對分數。
  5. 驗證:系統使用橋接驗證方法,整合不同版本評估模型的證據。

適用對象

  • 希望衡量 LLM 創造性寫作品質的 AI 研究人員與開發者。
  • 對比較不同前沿模型敘事表現感興趣的使用者。

亮點

  • 受限創造力:衡量特定情節元素的整合,而不僅是關鍵字的包含。
  • 相對排名:採用一對一比較系統,生成模型表現排行榜。
  • 全面資料:包含公開成果,如故事提示、生成文字與機器可讀的排行榜表格。
  • 診斷工具:追蹤評估者一致性與字數合規性,確保基準測試的可靠性。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案