Hugging Face 推出 BenchMIRT:审计 LLM 基准测试究竟在测什么
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的方法,基于多维项目反应理论(MIRT)分离出安全与通用推理两个主导维度。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知各基准测什么却稳定复现这两个维度。分析显示 BBQ、WMDP 等安全基准的得分更多与通用推理相关,单一基准分数可能混合多种信号。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的方法,基于多维项目反应理论(MIRT)分离出安全与通用推理两个主导维度。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知各基准测什么却稳定复现这两个维度。分析显示 BBQ、WMDP 等安全基准的得分更多与通用推理相关,单一基准分数可能混合多种信号。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、预测增强并定位甲烷羽流,在专家标注羽流上召回率达 84%。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
Hugging Face WebAI 团队发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的轻量库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布为独立仓库。
Google Research 发布 TimesFM-3,这是其首个原生预训练支持多变量预测的时间序列基础模型,参数量 3.3 亿,预训练语料超过 1 万亿个时间点。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理分析算力需求,并采用 Apache 2.0 开源。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,印地语成为该多语言榜单上的首个印度语言。
Google Research 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,并生成报告,把原本需要数周人工数据工程的建模过程压缩到数分钟。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来更可控的生成视频能力,通过 Gemini API 在 Google AI Studio 提供。
Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学隔离环境中,避免模型提前接触测试题。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。
Google 发布自监督基础模型 GlucoFM,采用双流设计分离缓慢血糖趋势与短期波动,在 109,066 小时无标注 CGM 数据上预训练。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比最优 GluFormer 变体高 5.8 个百分点,并在餐后血糖响应预测中取得最低 MAE。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文本模型,可直接把原始音频转成准确、经过格式化的文本。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,并配套完整训练方案。
Google 发布研究原型 AgentHands(论文发表于 CHI 2026),可将 LLM 的推理输出映射为 XR 头显中与语音同步的手势动画,让智能体在 3D 空间里指点、演示物体操作。系统包含环境感知、手势事件库、手势嵌入推理与本地同步执行四个模块,支持递指、象形和表达三类手势。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指代效果上有显著提升。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、仅解码器的推理模型家族,包含 3B、8B、30B 三个尺寸,均以 Apache 2.0 许可开源。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
Hugging Face 在 Gradio 中推出 gr.Workflow,把多步 AI 管线描述为带类型节点的图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。该系统在三个队列共 9,279 条参与者观测中自动识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,例如睡眠时长变异性与 PHQ-8 严重程度的关联(ρ = 0.252)。
Google DeepMind 与 Fenris Creations 达成新研究合作,围绕 EVE Online 所在的 EVE Universe 探索 AI 驱动的全新玩法原型。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化出行模式与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Papers with Code 的论文搜索采用混合检索架构,由 Hugging Face Jobs 批量生成嵌入向量、Storage Buckets 做持久化中转、Inference Endpoints 提供在线查询的低延迟嵌入,目前覆盖 arXiv 与 Daily Papers 的逾 11 万篇论文。
Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三项测试来量化语音识别中的基准优化现象。研究评测 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾、相关词被静音或两种写法在音频中同样成立。
Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。该版本已可在 CP2K 中使用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检视并核实信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务测试八款模型后发现,智能体记忆不是开关而是需要按模型校准的剂量。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚期交互检索,可直接加载 PyLate、Stanford-NLP ColBERT 检查点以及 colpali-engine 的视觉文档检索模型。
Hugging Face 博客介绍了一个约束感知 GPU 分配器,在相同硬件和相同负载下对比 FIFO 调度器,五个真实争用场景中 GPU 利用率从 52–85% 提升到 72–88%,优先级加权产出提升 24.6%–105.1%、平均 52%。
Google Research 提出 PhotoScan,一个可从普通 2D 手机照片估算体脂率、A/G 比值和 V/S 比值的深度学习框架,用于预测胰岛素抵抗。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型观察报告,基于 Hub 数据指出中国实验室在多数月份推出的最大开源模型参数量超过美国实验室,中国月度上限在 754B 至 2.78 万亿参数之间,美国模型在七个月中有五个月低于 130B。
Hugging Face 博客给出 Strands Robots 的流式数据闭环教程,用同一个 Robot() 对象完成录制演示、同步到 Storage Bucket、从 Hub 流式读取训练并把 checkpoint 部署回硬件,全程保持 LeRobot 磁盘格式不变。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文,共发布 6816 份 Trackio 日志,覆盖 2226 篇论文,约占大会论文的三分之一。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时段、编码器变体和分辨率,获得 Cloud-Optimized GeoTIFF(COG)格式结果。
微软研究院推出 MindTopo 基准,用于评估多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧保留结构关系时有用,跨多步操作后常改变拓扑或违反任务约束。
Google DeepMind 发布多语言手语转文本模型 SL2T,首次把该能力带入消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
Google Research 提出知识画像框架,用 2,150 条 Wikipedia 事实的 WikiProfile 基准评测 13 个 LLM,发现 Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却仍有 26–34% 无法直接召回,开启思考后仍有 11–12% 失败。研究认为前沿模型的事实错误更多源于知识可及性不足,而非知识缺失,瓶颈正从知识获取转向知识利用。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可实时进行视频临床问诊,感知非语言线索并引导虚拟体格检查。
微软研究院发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,可同时完成报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。CARE-X 支持生成与双推理两种模式,覆盖病灶有无与否定、定位、多标签分类、导管与管线异常位置检测及 29 个解剖区域定位等任务。