返回模型榜
评测来源
每个来源测什么、怎样更新、是否进入排名,都可以在这里找到。
- 本轮参与排名
- 20
- 已审查来源与专项
- 69
综合评测与体验
17跨能力的综合测试与真人盲选。
- AA Index把多项当前评测放到同一套环境里复跑,得到一个综合能力分。价格只作参考,不进总分。Artificial Analysis参与排名证据预算 30%
- LiveBench题库持续更换,答案可以自动核对。用来看模型换题之后还能不能站住。LiveBench交叉参考
- Arena Text真人匿名两两比较回答,看大家更愿意读哪一个。补上选择题看不出的整体体验。LMArena参与排名证据预算 5%
- Arena WebDev同样是真人盲选,比的是网页好不好用、能不能交付。LMArena参与排名证据预算 2.4%
- LiveBench · 语言与指令Language + IF 两项均分,各占 50%。LiveBench参与排名证据预算 3%
- Arena 创作盲选真人盲选故事、诗歌和其他创意表达,观察作品是否吸引读者。LMArena参与排名证据预算 5%
- Design Arena · 视觉设计真人盲选网页、界面、图表和幻灯片的设计作品。Design Arena / Intelligence观察中
- EQ-Bench 4 · 情绪与人际理解在多轮交流中理解人物情绪、隐含需求与不同的沟通偏好。EQ-Bench观察中
- Short-Story · 短篇小说把固定人物、情节与风格要求自然写进一篇完整短篇小说。Lech Mazur观察中
- ToneBench · 文风与脚本按指定作者文风写视频脚本,考查开场、结构、表达与口播节奏。Towards AI观察中
- TubeLab · 视频脚本面向不同视频频道写脚本,比较故事组织、文风、节奏与清晰度。TubeLab观察中
- NC Bench · 作家工作流帮助作家改写、续写、总结、翻译和整理创作想法。Novelcrafter观察中
- OpenVibeEval · 网页作品对照网页作品、可访问性和盲选偏好,观察不同工具下的设计表现。OpenVibeEval观察中
- SVGBench · 矢量图盲选按相同提示盲选 SVG,考查视觉清晰度与图形表现。SVGBench观察中
- Rapidata SVG真人比较模型生成的矢量图,直接评价视觉偏好。Rapidata观察中
- Creative Writing v3短篇创作与表达EQ-Bench参与排名证据预算 3.6%
- Longform Writing长篇故事的连贯性与完整性EQ-Bench参与排名证据预算 2.4%
编程
13从写代码到改仓库,看模型能不能把软件做出来。
- DeepSWE v1.1在统一的编程助手环境里改仓库、修缺陷,比较的是写代码的模型本身。DataCurve参与排名证据预算 3.6%
- TapTap Maker在真实游戏引擎里用 Lua 写出能跑起来的功能。分数由引擎执行判定,不用另一个模型打分。TapTap Maker参与排名证据预算 3.6%
- LiveBench · 编程综合Coding + Agentic Coding 两项均分,各占 50%。LiveBench参与排名证据预算 2.4%
- Hyper-τ-bench根据业务资料构建并测试能工作的客户服务代理。Sierra观察中
- SWE-rebench持续收集真实仓库问题,比较模型在多种编程语言中的软件修复能力。Nebius观察中
- LHTB在较长时间内持续使用终端,完成复杂工程与工具任务。Tencent HY / Lehigh 等观察中
- Terminal-Bench 4保留模型搭配不同 Agent 在终端任务中的原始成绩,供交叉核对。Harbor / Terminal-Bench仅供参考
- MirrorCode长时间的软件复现Epoch AI仅供参考
- Code Migration软件迁移与接口改造Vals AI观察中
- ProgramBench完整程序的实现与交付Vals AI观察中
- FrontierCode真实仓库任务的质量、测试与修改范围Cognition观察中
- FrontierSWE v2长时间运行的工程实现与研究任务Proximal Labs观察中
- WeirdML在陌生数据上实现机器学习方案WeirdML观察中
推理
11数学、逻辑与陌生规则,看模型能不能想明白新问题。
- LiveBench · 推理与数学Reasoning + Mathematics 两项均分,各占 50%。LiveBench参与排名证据预算 4.2%
- SimpleBench用日常常识和逻辑问题,检验模型能否识别问题中的实际约束。SimpleBench观察中
- FrontierMath v2 · Tiers 1–3研究级数学推理Epoch AI参与排名证据预算 3.6%
- FrontierMath v2 · Tier 4更高难度的数学研究题Epoch AI参与排名证据预算 1.2%
- Chess Puzzles根据文字棋局寻找正确走法Epoch AI参与排名证据预算 1.8%
- Mystery Game Puzzles从陌生规则推导正确行动Epoch AI参与排名证据预算 1.2%
- MathArena · ArXivLean用 Lean 验证数学证明MathArena / ETH Zurich观察中
- MathArena · BrokenArXiv发现和修复数学证明中的错误MathArena / ETH Zurich观察中
- MathArena · ArXivMath从近期数学论文提炼的新题MathArena / ETH Zurich观察中
- ARC-AGI-2从陌生规则中学习和泛化ARC Prize观察中
- ARC-AGI-3从陌生规则中学习和泛化ARC Prize观察中
知识
5事实问答与研究生级科学知识,看知识掌握与回答准确性。
专业办公
19金融分析、法律咨询与银行业务,看专业任务能否完成。
- APEX-Agents 1.1投行、咨询和法律里的长任务,看模型当助手能不能把一件完整的工作做完。Mercor参与排名证据预算 4%
- Vals Finance Agent金融分析师的日常办公题,看研报、建模这类工作做得怎样。Vals AI参与排名证据预算 3%
- OfficeQA Pro从大量真实财务文件中检索、计算并回答问题。Databricks观察中
- Harvey Legal Agent Benchmark处理法律资料并交付 Word、Excel、幻灯片等可审阅文件。Vals AI / Harvey观察中
- MCP Atlas通过真实 MCP 服务检索资料、操作文档与数据库,完成跨软件任务。Scale AI观察中
- FinanceBenchmark完成金融定价、资本计算和风控任务,用数值与代码执行结果核验。FinanceBenchmark观察中
- PRBench · Legal回答真实法律工作中的复杂问题,检验专业判断和论证质量。Scale AI观察中
- PRBench · Finance回答真实金融决策问题,检验专业判断、推导和风险说明。Scale AI观察中
- SpreadsheetBench 2完成财务建模、修复工作簿和数据可视化的整套表格工作。SpreadsheetBench / Renmin University / AfterQuery观察中
- Vending-Bench 2经营模拟商店一年,处理采购、谈判、库存与定价。Andon Labs观察中
- τ³-Banking在统一工具环境中办理银行业务,检验规则理解、客户沟通与任务完成。Sierra等待成绩证据预算 2%
- EBR-bench在长任务中学习新规则并使用记忆Epoch AI仅供参考
- Excel · EMB表格编辑与 Excel 办公Vals AI观察中
- Legal Research法律检索和论证Vals AI观察中
- TaxAgentBench税务专业问题Vals AI观察中
- MedScribe临床记录整理与撰写Vals AI观察中
- BioMysteryBench生物学研究推理Vals AI观察中
- AutomationBench跨办公软件完成自动化工作Zapier观察中
- Terminal-Bench Science在终端里完成科研任务Harbor观察中
视觉理解
2理解图片的证据继续保留在综合榜;读懂图片与设计美观是不同能力。
中文与多语言
2语言基础的补充证据,不把英文写作表现当作中文能力。
“观察中”表示仍在核对数据、运行条件或使用边界,不参与综合榜和分类榜。同一评测的重复抓取和展示切片不会增加票权;不同评测之间的题库重叠仍需持续核对。