評価の出典公式の評価
Short-Story · 短編小説
Lech Mazur · 指定された人物、筋書き、文体の要件を自然に織り込み、一編の短編小説として完成させる。
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません
何をどう測るか
600〜800 語の短編、10 項目の創作要件。同一プロンプト、3 社の審判、双方向比較。Thurstone 主スコアを採用し、BT は診断のみ、重複して票を数えない。複数レベルは固定ルールで選ぶ。
この根拠の使い方
観察中:正式なデータ再利用の範囲を整え、READMEと機械成績の不一致を解消してから接続する。
評価の限界とデータの出典
モデル審判には依然として文学的嗜好がある。一部の型番は全ストーリーを完了していない。短編の能力は長編小説や中国語の文章力とは異なる。
データのライセンス:明確なランキングデータの再利用許諾は見つかっていない。GitHub での公開はオープンライセンスを意味しない。
スコアは Lech Mazur が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。