Google Research 研究:AI 评测需要多少标注者才够?
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,反映人类意见分歧常需超过 10 名。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,反映人类意见分歧常需超过 10 名。
Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线密码学所需量子比特和门数比此前估计更少。
Google Research 发布 TurboQuant 压缩算法,可在不损失模型精度的情况下把 KV cache 量化到 3 bit,无需训练或微调,并配套提出 QJL 与 PolarQuant 两种方法。
Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 分区与特征栅格化,将建筑、道路等建成环境特征转为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。评测中 S2Vec 在零样本地理外推的社会经济预测任务(如全美人口密度、收入中位数)上表现优于 SATCLIP、GEOCLIP 等基线,但在树木覆盖、海拔等环境任务上仍需改进。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统在 NHS 乳腺筛查流程中的表现。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融达到 SPEX 的性能。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,由医生通过视频实时监督。
Google Research 发布 WAXAL 大规模开放语音数据集,初期覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,以 CC-BY-4.0 许可开放。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统信息量,并在 NeurIPS 2025 论文中验证其能预测彩色摄影、射电天文、无镜头成像和显微镜四个领域的解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器设计。
伯克利 AI 研究提出一种基于分治(divide and conquer)的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。
伯克利 AI 研究团队提出首个可定量预测 word2vec 学习过程的理论,证明在现实训练条件下该问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即 M* 的顶部特征向量,可由语料统计和超参数预先算出。