本文へ移動
評価の出典

ToneBench · 文体とスクリプト

Towards AI · 指定された著者の文体で動画スクリプトを書き、導入・構成・表現・読み上げのリズムを評価する。

公式の評価
News での扱い観察中
根拠の配分採点に使わない
元データの時点未確認
最後に同期に成功まだ取得していません

何をどう測るか

10 件の実タスク、複数回生成、3 社の審判。同一タスク・ルーブリック・審判・実行フィンガープリントのみを比較する。混合モデルのフォールバック行は除外し、各列の最高スコアで構成を選ばない。

この根拠の使い方

観察中:データプロトコルと当期の網羅は良好で、成績の再表示境界の確認と純粋なモデル設定の検証を待つ。

評価の限界とデータの出典

Towards AI の単一チャンネルの文体に偏り、正確な問題と参考スクリプトは非公開。現在の首位には Fable 5 + Opus 4.8 のフォールバックが含まれ、単一モデルの成績としては扱えない。

データのライセンス:公開 JSON は読み取り可能だが、明確なデータ集約と再展示の条項はまだ見つかっていない。

スコアは Towards AI が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。