本文へ移動
評価の出典

Short-Story · 短編小説

Lech Mazur · 指定された人物、筋書き、文体の要件を自然に織り込み、一編の短編小説として完成させる。

公式の評価
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません

何をどう測るか

600〜800 語の短編、10 項目の創作要件。同一プロンプト、3 社の審判、双方向比較。Thurstone 主スコアを採用し、BT は診断のみ、重複して票を数えない。複数レベルは固定ルールで選ぶ。

この根拠の使い方

観察中:正式なデータ再利用の範囲を整え、READMEと機械成績の不一致を解消してから接続する。

評価の限界とデータの出典

モデル審判には依然として文学的嗜好がある。一部の型番は全ストーリーを完了していない。短編の能力は長編小説や中国語の文章力とは異なる。

データのライセンス:明確なランキングデータの再利用許諾は見つかっていない。GitHub での公開はオープンライセンスを意味しない。

スコアは Lech Mazur が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。