微软研究院推出 CARE-X:面向临床可用的放射学 VLM,融合辅助监督、奖励对齐学习与工具增强测量
微软研究院发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,可同时完成报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。CARE-X 支持生成与双推理两种模式,覆盖病灶有无与否定、定位、多标签分类、导管与管线异常位置检测及 29 个解剖区域定位等任务。
微软研究院发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,可同时完成报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。CARE-X 支持生成与双推理两种模式,覆盖病灶有无与否定、定位、多标签分类、导管与管线异常位置检测及 29 个解剖区域定位等任务。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》。
Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天预警时间,相当于气象领域约十年的进展。
微软研究院提出 Echoverse,为 computer-use 智能体构建十二个训练世界,包括十个深度领域世界和两个能力世界,并开源其中四个世界的代码、数据与评分器。
Hugging Face 博客指出,AI 的下一个真正约束不是智能而是 GPU 利用率:GPU 按日历小时计费,却只在计算小时产出,与航空业飞机停场成本结构相同。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分作为辅助 RL 任务。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元 AI tokens 和云 credits,支持 Genesis Mission 的研究人员。
DharmaOCR 在葡萄牙语 OCR 基准上以 0.925 的得分超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过两阶段训练实现领域专精:先以葡萄牙语语料监督微调,再用 DPO 提升推理稳定性。作者认为,尽管新架构不断涌现,专注单一语言的参数集中策略仍构成结构性优势。
Google Research 在 ICLR 2026 论文中揭示,扩散模型的创造力源于神经网络训练中权重衰减等正则化带来的 score smoothing——它使学到的 score function 变平滑,让去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。
Google Research 与 Google DeepMind 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自 500 万同意参与者、超过 1 万亿分钟的多模态传感器信号,覆盖 100 多个国家、20 多款 Fitbit 和 Pixel Watch 设备。
随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,UC Berkeley 的 Aditya G. Parameswaran 等人提出智能体时代数据系统的三大方向:面向智能体(For Agents)、由智能体运行(Of Agents)、由智能体构建(By Agents)。
Hugging Face 发布 PRX 系列第四篇,详解其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,并转为可流式训练的语料。团队用 Lance 做数据构建与筛选、MDS 做流式训练,改用 Qwen3-VL 后在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天)。
Google Research 将建筑级屋顶反射率(albedo)数据集从 2024 年的 14 座城市扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程即可在单次前向传播中完成预测。
Hugging Face 提出 DiScoFormer(Density and Score Transformer),给定一组数据点即可在单次前向传播中同时估计分布的密度与 score,无需针对新分布重新训练。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转为可操作的树篱、石墙与矮林清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星影像上预训练的 RSF Vision-Transformer 骨干,仅用约 247 平方公里标注数据微调,并用 Polsby–Popper 紧凑度分数(线性特征阈值小于 0.5)区分林地、树丛与树篱。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,试验为期八周。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,供各国气象与水文机构将 AI 洪水预报整合进自身工作流。该框架是使用 PyTorch 的 Python 包,采用 LSTM 网络架构,可基于 Caravan 数据集训练或微调模型,并附带交互式教程 notebook 和视频教程。
Mistral 将 Emmi AI 并入后推出物理 AI 基础能力,用于 AI 原生工业工程,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。该模型从几何与边界条件直接预测物理场,单次前向传播在单 GPU 上以秒级完成,而传统 CFD/FEM 仿真每个设计变体需数小时至数周。它面向设计迭代提速,传统求解器仍保留用于验证和边缘场景。
Mistral 收购 Emmi AI,并加倍投入面向航空航天、汽车、半导体和能源等行业的 Physics AI 基础研究。其成果包括 AB-UPT 可在单张 GPU 上处理 900 万表面单元和 1.4 亿体积单元,以及面向 3D 机翼跨音速流场的约 30,000 个 CFD 仿真样本数据集。
Mistral AI 本周签署最终协议收购 Physics AI 先驱 Emmi AI,以强化其面向工业企业的 AI 转型服务能力。Emmi AI 成立于奥地利,团队超过 30 名研究人员和工程师,专注大型工程模型,可将多日计算替换为实时仿真并构建数字孪生,其联合创始人及团队将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature,并作为 Gemini for Science 的一部分向全球科学家开放。
剑桥大学教授 Clare Bryant 使用 Google Co-Scientist 研究流感等病原体跨物种传播引发败血症的分子机制,该工具生成并排序的假说帮她锁定了一个此前未关注的蛋白,并逐步细化到具体氨基酸位点。她的团队正构建携带这些氨基酸突变的细胞系验证假说,原本需两到三年的实验工作预计可在六个月内完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合衰老生物学中零散的研究发现并生成可验证假设。
Google DeepMind 的 Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关文献,将想法转化为可检验假设并按可行性与风险收益排序。
斯坦福大学医学院 Gary Peltz 团队利用 Google Co-Scientist 筛选抗肝纤维化药物,其提出的 3 个候选药物中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自行挑选的 2 个药物均无效。其中抗癌药 vorinostat 阻断了 91% 可驱动肝瘢痕形成的损伤反应,相关研究已发表于 Advanced Science。
Google Research 披露其开源工具与开放数据集已赋能全球超 25 万名研究者和开发者。其中基因组学工具 DeepVariant、DeepConsensus、DeepPolisher 已支持处理 250 万人的外显子与全基因组,医疗基础模型 MedGemma 下载量超 480 万次。Open Health Stack 已在 10 多个国家部署,覆盖超 6500 万受益者。
Google Research 介绍科学家如何使用其 Empirical Research Assistance(ERA)工具推进科研,涵盖流行病预测、宇宙学、碳监测和神经科学四个方向。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算孤岛,孤岛间以异步数据流通信,从而隔离局部硬件故障。
Google 提出推理优先的合成数据生成框架 Simula,将数据集构建重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评家质量检查四个步骤,从零构建数据集,无需种子数据。
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形态,为 PATHFINDER 重建模型补充训练数据,在保留的小鼠轴突上把重建错误率降低 4.4%,主要来自合并错误的减少。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,反映人类意见分歧常需超过 10 名。
Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 分区与特征栅格化,将建筑、道路等建成环境特征转为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。评测中 S2Vec 在零样本地理外推的社会经济预测任务(如全美人口密度、收入中位数)上表现优于 SATCLIP、GEOCLIP 等基线,但在树木覆盖、海拔等环境任务上仍需改进。
Mistral AI 推出 Forge,一套让企业基于专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 两种架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练与治理。
Mistral AI 以创始成员身份加入 NVIDIA Nemotron Coalition,双方计划联合开发前沿开源 AI 模型,Mistral AI 提供模型架构、多模态能力与微调工具,NVIDIA 提供算力、模型开发工具与合成数据管线。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融达到 SPEX 的性能。
Google 宣布在 Flood Hub 上线城市山洪预报,借助新的 AI 方法可在城市区域提前最多 24 小时预测山洪风险。
Google Research 推出 Groundsource,一种用 Gemini 从全球新闻中提取结构化历史灾害数据的方法,并发布首个开放数据集,包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
Google Research 发布 WAXAL 大规模开放语音数据集,初期覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,以 CC-BY-4.0 许可开放。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统信息量,并在 NeurIPS 2025 论文中验证其能预测彩色摄影、射电天文、无镜头成像和显微镜四个领域的解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器设计。