Google 提出 Simula:基于推理的合成数据生成框架
Google 提出推理优先的合成数据生成框架 Simula,将数据集构建重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评家质量检查四个步骤,从零构建数据集,无需种子数据。
Google 提出推理优先的合成数据生成框架 Simula,将数据集构建重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评家质量检查四个步骤,从零构建数据集,无需种子数据。
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形态,为 PATHFINDER 重建模型补充训练数据,在保留的小鼠轴突上把重建错误率降低 4.4%,主要来自合并错误的减少。
Google 发布研究实验 Vantage,通过生成式 AI 构建模拟对话环境,评估高中与大学生的问题解决、协作等未来技能,现已在 Google Labs 开放英文注册。该系统由 Executive LLM 动态引导对话、AI Evaluator 依据评分量表打分,与纽约大学合作对 188 名 18-25 岁美国测试者的研究显示,AI 评分与人类专家评分的一致性接近两位人类专家之间的一致性。
Google Research 推出 ConvApparel,一个包含 4000 多组人机多轮对话(近 15000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Google 发布两款学术智能体:PaperVizAgent 负责生成论文配图,ScholarPeer 负责自动同行评审。PaperVizAgent 由检索、规划、风格、可视化、评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any,是唯一超过 50.0 人类基线的框架。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT),在真实用户-助手场景中评估 LLM 行为倾向与人类共识的对齐程度。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,反映人类意见分歧常需超过 10 名。
Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线密码学所需量子比特和门数比此前估计更少。
Google Research 发布 TurboQuant 压缩算法,可在不损失模型精度的情况下把 KV cache 量化到 3 bit,无需训练或微调,并配套提出 QJL 与 PolarQuant 两种方法。
Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 分区与特征栅格化,将建筑、道路等建成环境特征转为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。评测中 S2Vec 在零样本地理外推的社会经济预测任务(如全美人口密度、收入中位数)上表现优于 SATCLIP、GEOCLIP 等基线,但在树木覆盖、海拔等环境任务上仍需改进。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统在 NHS 乳腺筛查流程中的表现。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融达到 SPEX 的性能。
Google Research 推出 Groundsource,一种用 Gemini 从全球新闻中提取结构化历史灾害数据的方法,并发布首个开放数据集,包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,由医生通过视频实时监督。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统信息量,并在 NeurIPS 2025 论文中验证其能预测彩色摄影、射电天文、无镜头成像和显微镜四个领域的解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器设计。
伯克利 AI 研究提出一种基于分治(divide and conquer)的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。
伯克利 AI 研究团队提出首个可定量预测 word2vec 学习过程的理论,证明在现实训练条件下该问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即 M* 的顶部特征向量,可由语料统计和超参数预先算出。