本文へ移動
評価の出典

TapTap Maker Benchmark

TapTap Maker / コーディング · 実際のゲームエンジンでLuaを使い、動作する機能を書く。スコアはエンジンの実行で判定し、別のモデルによる採点は行わない。

公式の評価
News での扱い順位に反映
根拠の配分3.6%
元データの時点09/10 08:00
最後に同期に成功10/01 20:05

何をどう測るか

公式main_boardのL2通過率のみを採用。コスト、速度、Held-out、分類スコアは再投票しない。同一の基盤モデルは固定の推論ティア優先順位で代表行を選び、選択はスコアを見ずに行う。

この根拠の使い方

コーディングとデザインの予算のうち3.6%。エンジンとL2指標を固定。

評価結果

固定ルールに従い、各公開モデルは代表的な構成を1つ採用する。匿名テスト型番は表示せず、元のランキング順位を保持し、各項目は最大30件。

元の順位元のモデル名元のスコア代表的な設定
1claude-fable-5-1Anthropic90.5%High 推論
2claude-fable-5Anthropic89.0%High 推論
3gpt-6-astraOpenAI88.9%xHigh 推論
4claude-opus-5Anthropic88.9%xHigh 推論
6grok-4.6@xhighxAI87.3%xHigh 推論
7gemini-3.8-flashGoogle86.8%High 推論
8gpt-5.6-solOpenAI86.5%xHigh 推論
11glm-5.3Z.ai83.6%Max 推論
12qwen3.8-max-0902Alibaba83.3%xHigh 推論
13claude-opus-4-8Anthropic82.8%xHigh 推論
14qwen3.8-maxAlibaba82.5%xHigh 推論
15deepseek-v4.1-flashDeepSeek82.5%Max 推論
16qwen3.8-flashAlibaba82.5%xHigh 推論
17gpt-5.6-terraOpenAI81.8%xHigh 推論
18glm-5.3-flashZ.ai81.5%Max 推論
19hy4-previewTencent81.0%High 推論
20kimi-k3Moonshot AI79.7%情報源のデフォルト構成
21grok-4.5xAI78.3%High 推論
22doubao-seed-evolvingByteDance78.3%High 推論
23gpt-5.6-lunaOpenAI77.8%xHigh 推論
24deepseek-v4-proDeepSeek77.8%情報源のデフォルト構成
25claude-sonnet-5Anthropic76.2%xHigh 推論
27deepseek-v4-flashDeepSeek74.6%Max 推論
28qwen3.8-27bAlibaba68.3%xHigh 推論
29gemini-3.1-pro-previewGoogle64.7%情報源のデフォルト構成
30MiniMax-M3MiniMax60.1%情報源のデフォルト構成
31claude-haiku-4-5Anthropic43.6%High 推論
評価の限界とデータの出典

単一エンジン、単一言語であり、他の技術スタックに一般化できない。異なるモデルが異なる agent ドライバを使う可能性があり、クローズドソースの harness は問題ごとに再計算できない。

データのライセンス:公式公開結果。公開再表示時は公式の帰属表示を保持し、完全な再配布の許諾は依然として易玩/TapTapの条項による

スコアは TapTap Maker が公開。元のスコアと News のコンセンサススコアは尺度が異なるため、直接合算できない。