lechmazur/writing

This benchmark tests how well LLMs incorporate a set of 10 mandatory story elements (characters, objects, core concepts, attributes, motivations, etc.) in a short creative story

何を解決するか

このプロジェクトは、大規模言語モデル(LLMs)の創造的物語作成能力を評価するベンチマークを提供します。単なる自由形式の執筆を越えて、モデルが厳格な制約付きのクリエイティブ・ブリーフに従いながら、一貫性があり、独自性のある物語を構築できるかをテストします。

動作方法

モデルには、10の必須要素(キャラクター、物体、概念、設定、トーンなど)を含む制約付きブリーフが与えられます。その後、ペアワイズ比較法を用いて評価を行います:

  1. 物語生成:モデルは同じ固定ブリーフに基づいて物語を執筆します。
  2. ペアワイズ評価:別々の評価モデルが対応する物語ペアを読み、どちらが優れているかを選択します。
  3. 順序の無効化:物語は両方の順序で提示され、順序バイアスを防ぎます。
  4. スコアリング:個々の判断を相対的比較スコアと勝率パーセンテージに統合し、絶対評価ではなく相対評価を使用します。
  5. 検証:システムはブリッジ検証を用いて、異なるバージョンの評価モデルの証拠を統合します。

対象ユーザー

  • LLMの創造的執筆品質を測定したいAI研究者や開発者。
  • さまざまな最先端モデルの物語性能を比較したいユーザー。

特徴

  • 制約付き創造性:キーワードの含みだけでなく、特定の物語要素の統合を測定します。
  • 相対順位付け:対戦形式の比較システムにより、モデルのパフォーマンス順位表を作成します。
  • 包括的なデータ:物語プロンプト、生成テキスト、機械可読の順位表などの公開アーティファクトを含みます。
  • 診断ツール:評価モデルの合意度と単語数の遵守状況を追跡し、ベンチマークの信頼性を確保します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト