Skip to content
Evaluation sources

EBR-bench

Epoch AI / Professional work · Learn new rules and use memory during long tasks

Official evaluation
In NewsReference only
Evidence budgetNot scored
Upstream data as of09/30 02:13
Last synced10/01 20:05

What it measures, and how

The public aggregate mixes memory-compression configurations; it is for reference only until comparable scores under a fixed configuration are obtained.

How this evidence is used

For reference only; not counted towards overall or category scores.

Results

Under fixed rules, each public model uses one representative configuration. Anonymous test variants are not shown, original leaderboard ranks are kept, and each item lists at most 30.

Rank thereModel thereRaw scoreRepresentative configuration
1gpt-6-astra_maxOpenAI76.2%Max reasoning
2claude-opus-5-5_maxAnthropic71.4%Max reasoning
3claude-fable-5-1_maxAnthropic57.1%Max reasoning
4gpt-6.1-sol_max—54.3%Max reasoning
5gpt-6-sol_maxOpenAI53.3%Max reasoning
6claude-opus-5_maxAnthropic45.7%Max reasoning
7gpt-5.6-sol_maxOpenAI44.8%Max reasoning
8claude-fable-5_maxAnthropic39.5%Max reasoning
9gpt-5.5_xhighOpenAI34.3%xHigh reasoning
10grok-4.6_xhighxAI30.5%xHigh reasoning
11claude-opus-4-8_maxAnthropic28.6%Max reasoning
12gpt-5.4-2026-03-05_xhighOpenAI25.4%xHigh reasoning
13gpt-5.2-2025-12-11_xhighOpenAI23.0%xHigh reasoning
14claude-opus-4-7_maxAnthropic19.0%Max reasoning
15gemini-3.1-pro-previewGoogle14.3%Source default configuration
15claude-opus-4-5-20251101_128KAnthropic14.3%Source default configuration · 128k
17gpt-5-2025-08-07_highOpenAI12.7%High reasoning
17claude-opus-4-6_maxAnthropic12.7%Max reasoning
19qwen3.7-maxAlibaba9.5%Source default configuration
19glm-5.2_maxZ.ai9.5%Max reasoning
21claude-opus-4-1-20250805Anthropic7.9%Source default configuration
22gemini-3.5-flash_highGoogle4.8%High reasoning
23kimi-k2.6Moonshot AI2.4%Source default configuration
23claude-sonnet-4-5-20250929Anthropic2.4%Source default configuration
Limits and data attribution

For reference only; not counted towards overall or category scores.

Data licence: CC BY 4.0 · Epoch AI's own evaluation data

Scores published by Epoch AI. Raw scores and the News consensus score use different scales and cannot be added directly.