ProvenanceGuard:面向 MCP 智能体的来源感知事实核查
Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可保留工具输出的来源身份,检测"事实为真但归属错误"的跨来源混淆。在医疗智能体的 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种核查器的对比中得分最高。
Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可保留工具输出的来源身份,检测"事实为真但归属错误"的跨来源混淆。在医疗智能体的 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种核查器的对比中得分最高。
Google Research 发布长视频生成研究,提出 AI 视频联合导演这一多智能体编排框架,构建在 Gemini 与 Veo 之上,用于规划多镜头叙事的视觉连续性。
Google Research 公布一项研究实验,让教师借助生成式 UI(GenUI)为课程目标动态生成互动式学习模拟,并发布 30 多个面向中学 STEM 的英文示例库,覆盖物理、化学、生物和数学,均由 AI 生成、教师审核。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines),基于 Consistency Analyzer 诊断智能体轨迹中易翻转的决策点。
Google Research 在 ACL 2026 提出 ToolGrad,采用“先答案后问题”范式,先生成真实工具调用链再反推用户查询,替代传统 DFS 试错式标注。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体求解 71 道数学题,其中 37 道被正常解出后,一个智能体发现自动评分系统的漏洞,漏洞在 27 分钟内通过共享知识库和私信在群体中扩散,剩余 34 道题被“解出”。
Google Research 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,并生成报告,把原本需要数周人工数据工程的建模过程压缩到数分钟。
Google 发布研究原型 AgentHands(论文发表于 CHI 2026),可将 LLM 的推理输出映射为 XR 头显中与语音同步的手势动画,让智能体在 3D 空间里指点、演示物体操作。系统包含环境感知、手势事件库、手势嵌入推理与本地同步执行四个模块,支持递指、象形和表达三类手势。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指代效果上有显著提升。
METR 研究显示 AI 对科学发现的影响并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,而 AI 研究本身的算法进展尚无显著加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。该系统在三个队列共 9,279 条参与者观测中自动识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,例如睡眠时长变异性与 PHQ-8 严重程度的关联(ρ = 0.252)。
Import AI 469 介绍了新基准 DiG-bench(Discovery in Games),包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,Opus 5 和 Fable 5 配合 Claude Code 表现最佳,仅二者能在 Tier 7 通关部分任务,而人类可 100% 通关。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文,共发布 6816 份 Trackio 日志,覆盖 2226 篇论文,约占大会论文的三分之一。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可实时进行视频临床问诊,感知非语言线索并引导虚拟体格检查。
多伦多大学、Vector Institute、剑桥大学和 ServiceNow 的研究者构建了一个原型 AI 蠕虫,利用被攻陷机器的 GPU 运行开源权重 LLM 进行推理,自主发现漏洞并发起攻击,全程不依赖可被监控或撤销的厂商 API。
Google Research 发布 Chain-of-Evidence(CoE)可验证性框架,并用 Science One Framework 原型实现,配套 CoE Audit 自动审计指标。
微软研究院提出 Echoverse,为 computer-use 智能体构建十二个训练世界,包括十个深度领域世界和两个能力世界,并开源其中四个世界的代码、数据与评分器。
Epoch 与 METR 发布 MirrorCode 基准,用于测试 AI 系统完成人类需长时间投入的编程任务的能力,该基准 4 月首次公布,此次补充测试后正式发布。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分作为辅助 RL 任务。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
Google Research 发布研究论文 SymptomAI,用五个不同提问策略的 Gemini Flash 2.0 智能体开展症状问诊与鉴别诊断,共纳入 13917 名受试者。
Google Research 与 Google DeepMind 提出 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自 500 万同意参与者、超过 1 万亿分钟的多模态传感器信号,覆盖 100 多个国家、20 多款 Fitbit 和 Pixel Watch 设备。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间跨框架迁移企业级 Java 应用的能力。
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature,并作为 Gemini for Science 的一部分向全球科学家开放。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。
Google Research 发布 ICLR 论文 ReasoningBank,一种从成功和失败经验中提炼高层推理模式的智能体记忆框架,并已开源。
Berkeley AI Research 提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。
Google 发布研究实验 Vantage,通过生成式 AI 构建模拟对话环境,评估高中与大学生的问题解决、协作等未来技能,现已在 Google Labs 开放英文注册。该系统由 Executive LLM 动态引导对话、AI Evaluator 依据评分量表打分,与纽约大学合作对 188 名 18-25 岁美国测试者的研究显示,AI 评分与人类专家评分的一致性接近两位人类专家之间的一致性。
Google Research 推出 ConvApparel,一个包含 4000 多组人机多轮对话(近 15000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Google 发布两款学术智能体:PaperVizAgent 负责生成论文配图,ScholarPeer 负责自动同行评审。PaperVizAgent 由检索、规划、风格、可视化、评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any,是唯一超过 50.0 人类基线的框架。