Google Research 评估 LLM 行为倾向与人类的对齐程度
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT),在真实用户-助手场景中评估 LLM 行为倾向与人类共识的对齐程度。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT),在真实用户-助手场景中评估 LLM 行为倾向与人类共识的对齐程度。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,反映人类意见分歧常需超过 10 名。
Mistral AI 发布 Spaces CLI,同时面向人类开发者和编码智能体。它通过 `spaces init`、`spaces dev` 等命令完成项目脚手架、开发环境与部署,并为每个交互式提示提供对应的 flag,使智能体可自主完成端到端操作。每次 init 还会生成 context.json 和 AGENTS.md 两个文件,为智能体提供项目结构与规则上下文。
Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线密码学所需量子比特和门数比此前估计更少。
Google DeepMind 公布 AI 指针的实验性方案,由 Gemini 驱动,让指针不仅知道指向什么,还能理解它对用户的意义。团队提出四条交互原则,包括不打断工作流、捕捉指针周围的视觉与语义上下文、支持“这个”“那个”式的自然简写,以及把像素转化为地点、日期、物体等可操作实体。
Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成具备物理感知的 Android XR 应用,官方称耗时在 60 秒以内。
Google Research 发布 TurboQuant 压缩算法,可在不损失模型精度的情况下把 KV cache 量化到 3 bit,无需训练或微调,并配套提出 QJL 与 PolarQuant 两种方法。
Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 分区与特征栅格化,将建筑、道路等建成环境特征转为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。评测中 S2Vec 在零样本地理外推的社会经济预测任务(如全美人口密度、收入中位数)上表现优于 SATCLIP、GEOCLIP 等基线,但在树木覆盖、海拔等环境任务上仍需改进。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数规模 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可通过 API 和 Mistral Studio 使用,定价为每 1k 字符 0.016 美元。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展,包括与 Fitbit 合作研究的 Personal Health Agent(PHA),发现其比单一任务应用更能支持长期健康。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统在 NHS 乳腺筛查流程中的表现。
Mistral AI 推出 Forge,一套让企业基于专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 两种架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练与治理。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的版本,采用 Apache 2.0 许可。
Mistral AI 以创始成员身份加入 NVIDIA Nemotron Coalition,双方计划联合开发前沿开源 AI 模型,Mistral AI 提供模型架构、多模态能力与微调工具,NVIDIA 提供算力、模型开发工具与合成数据管线。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。
Mistral AI 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral vibe 与免费 API 端点 labs-leanstral-2603。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融达到 SPEX 的性能。
Google 宣布在 Flood Hub 上线城市山洪预报,借助新的 AI 方法可在城市区域提前最多 24 小时预测山洪风险。
Google Research 推出 Groundsource,一种用 Gemini 从全球新闻中提取结构化历史灾害数据的方法,并发布首个开放数据集,包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,由医生通过视频实时监督。
Mistral 基于其开源编码助手 Vibe 搭建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试,并在 CI/CD 流程中无需人工干预运行。
Google Research 发布 WAXAL 大规模开放语音数据集,初期覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,以 CC-BY-4.0 许可开放。
Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文本模型。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。
Mistral AI 团队在 Mistral Medium 3.1 的 Prefill/Decode 分离式部署中排查到 vLLM 内存泄漏,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。泄漏仅出现在启用图编译、经 NIXL 传输 KVCache 的 decode 侧,Heaptrack 显示堆内存稳定,问题出在堆外。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统信息量,并在 NeurIPS 2025 论文中验证其能预测彩色摄影、射电天文、无镜头成像和显微镜四个领域的解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器设计。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。
Mistral AI 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
Mistral AI 宣布与 SAP 建立多年期合作,为其 AI Foundation 集成 Mistral 模型,并共同开发面向欧洲复杂行业与公共部门的定制方案;同时与 Helsing 加速研发用于国防与安全场景的 vision-language-action 模型。Mistral AI 还将在未来数月内于德国开设办公室,并大幅扩充本地团队。
伯克利 AI 研究提出一种基于分治(divide and conquer)的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。
Mistral 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
Mistral AI 宣布完成 17 亿欧元 C 轮融资,投后估值 117 亿欧元,由半导体设备厂商 ASML 领投,DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 等现有投资方参投。
Mistral AI 为 Le Chat 上线 Memories(beta),采用自动保存、智能召回并始终显示来源的混合方案。用户可随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,并支持导出与从其他平台导入。同步推出 Memory Insights,基于用户自身数据提示趋势与摘要,后续将支持记忆分类整理与即时遗忘。
Mistral 在 Le Chat 中发布 20+ 个基于 MCP 的安全连接器目录(beta),覆盖数据、生产力、开发、自动化、商业等类别,支持接入 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并可添加自定义 MCP 连接器或连接任意远程 MCP 服务器。
伯克利 AI 研究团队提出首个可定量预测 word2vec 学习过程的理论,证明在现实训练条件下该问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即 M* 的顶部特征向量,可由语料统计和超参数预先算出。
Mistral 用 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上显著优于未微调基线,并减少了模型幻觉出的无效类别名。微调通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优,数据集划分为 8,000 训练样本和 2,000 测试样本。
Mistral AI 发布 Codestral 25.08,并推出面向企业的完整编码栈,包含 Codestral、Codestral Embed、Devstral 与 Mistral Code IDE 插件。
Mistral AI 联合 Carbone 4 和法国生态转型署(ADEME)完成首个 AI 模型全生命周期分析,并公开 Mistral Large 2 的环境足迹:截至 2025 年 1 月,训练加 18 个月使用共产生 20.4 ktCO₂e、消耗 281000 立方米水、660 kg Sb eq 资源消耗。