評価の出典公式の評価
TapTap Maker Benchmark
TapTap Maker / コーディング · 実際のゲームエンジンでLuaを使い、動作する機能を書く。スコアはエンジンの実行で判定し、別のモデルによる採点は行わない。
News での扱い順位に反映
根拠の配分3.6%
元データの時点09/10 08:00
最後に同期に成功10/01 20:05
何をどう測るか
公式main_boardのL2通過率のみを採用。コスト、速度、Held-out、分類スコアは再投票しない。同一の基盤モデルは固定の推論ティア優先順位で代表行を選び、選択はスコアを見ずに行う。
この根拠の使い方
コーディングとデザインの予算のうち3.6%。エンジンとL2指標を固定。
評価結果
固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。
| 元の順位 | 元のモデル名 | 元のスコア | 代表的な設定 |
|---|---|---|---|
| 1 | claude-fable-5-1Anthropic | 90.5% | High 推論 |
| 2 | claude-fable-5Anthropic | 89.0% | High 推論 |
| 3 | gpt-6-astraOpenAI | 88.9% | xHigh 推論 |
| 4 | claude-opus-5Anthropic | 88.9% | xHigh 推論 |
| 6 | grok-4.6@xhighxAI | 87.3% | xHigh 推論 |
| 7 | gemini-3.8-flashGoogle | 86.8% | High 推論 |
| 8 | gpt-5.6-solOpenAI | 86.5% | xHigh 推論 |
| 11 | glm-5.3Z.ai | 83.6% | Max 推論 |
| 12 | qwen3.8-max-0902Alibaba | 83.3% | xHigh 推論 |
| 13 | claude-opus-4-8Anthropic | 82.8% | xHigh 推論 |
| 14 | qwen3.8-maxAlibaba | 82.5% | xHigh 推論 |
| 15 | deepseek-v4.1-flashDeepSeek | 82.5% | Max 推論 |
| 16 | qwen3.8-flashAlibaba | 82.5% | xHigh 推論 |
| 17 | gpt-5.6-terraOpenAI | 81.8% | xHigh 推論 |
| 18 | glm-5.3-flashZ.ai | 81.5% | Max 推論 |
| 19 | hy4-previewTencent | 81.0% | High 推論 |
| 20 | kimi-k3Moonshot AI | 79.7% | 情報源のデフォルト構成 |
| 21 | grok-4.5xAI | 78.3% | High 推論 |
| 22 | doubao-seed-evolvingByteDance | 78.3% | High 推論 |
| 23 | gpt-5.6-lunaOpenAI | 77.8% | xHigh 推論 |
| 24 | deepseek-v4-proDeepSeek | 77.8% | 情報源のデフォルト構成 |
| 25 | claude-sonnet-5Anthropic | 76.2% | xHigh 推論 |
| 27 | deepseek-v4-flashDeepSeek | 74.6% | Max 推論 |
| 28 | qwen3.8-27bAlibaba | 68.3% | xHigh 推論 |
| 29 | gemini-3.1-pro-previewGoogle | 64.7% | 情報源のデフォルト構成 |
| 30 | MiniMax-M3MiniMax | 60.1% | 情報源のデフォルト構成 |
| 31 | claude-haiku-4-5Anthropic | 43.6% | High 推論 |
評価の限界とデータの出典
単一エンジン、単一言語であり、他の技術スタックに一般化できない。異なるモデルが異なる agent ドライバを使う可能性があり、クローズドソースの harness は問題ごとに再計算できない。
データのライセンス:公式公開結果。公開再表示時は公式の帰属表示を保持し、完全な再配布の許諾は依然として易玩/TapTapの条項による
スコアは TapTap Maker が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。