跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 1–9 条 · 共 9 条

10月1日

星期四今天
  1. Google 发布 Gemini 4 Argon,缩小与 OpenAI、Anthropic 的差距但未取得明显领先

    Google 发布新前沿模型 Gemini 4 Argon,在部分基准上超过 OpenAI 和 Anthropic 的竞品,但未取得明显领先。该模型先面向 Fairwind 计划的“可信网络防御者”和 Google 内部团队开放,之后才向开发者、企业和消费者推出,尚未公布日期;介绍性价格为每百万输入 token 2 美元、输出 token 10 美元,缓存输入便宜 95%。

9月29日

星期二

9月23日

星期三

8月28日

星期五

8月27日

星期四
  1. Google DeepMind 试点全球首个双盲 AI 评测

    Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学隔离环境中,避免模型提前接触测试题。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。

8月21日

星期五

8月4日

星期二

7月15日

星期三

5月16日

星期六