跳到正文

#Agent

今日 0 条

9月29日

星期二
  1. ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可保留工具输出的来源身份,检测"事实为真但归属错误"的跨来源混淆。在医疗智能体的 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种核查器的对比中得分最高。

9月25日

星期五

9月18日

星期五

9月16日

星期三

9月11日

星期五

9月7日

星期一

8月28日

星期五

8月26日

星期三
  1. Google 推出 AgentHands:为 XR 智能体对话生成空间化手势

    Google 发布研究原型 AgentHands(论文发表于 CHI 2026),可将 LLM 的推理输出映射为 XR 头显中与语音同步的手势动画,让智能体在 3D 空间里指点、演示物体操作。系统包含环境感知、手势事件库、手势嵌入推理与本地同步执行四个模块,支持递指、象形和表达三类手势。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指代效果上有显著提升。

8月24日

星期一
  1. Import AI 470:机器不应享有权利;用 SPADE 自动生成训练环境;用 Hawkeye 构建更好的 GPU kernel

    METR 研究显示 AI 对科学发现的影响并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,而 AI 研究本身的算法进展尚无显著加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。

8月22日

星期六
  1. Google 推出 Biomarker Discovery Framework:从可穿戴传感器数据中筛选候选生物标志物

    Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。该系统在三个队列共 9,279 条参与者观测中自动识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,例如睡眠时长变异性与 PHQ-8 严重程度的关联(ρ = 0.252)。

8月17日

星期一

8月13日

星期四

8月12日

星期三

8月3日

星期一

7月31日

星期五

7月27日

星期一

7月26日

星期日
  1. Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分作为辅助 RL 任务。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。

7月23日

星期四

7月9日

星期四

7月1日

星期三

5月20日

星期三

4月30日

星期四
  1. Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。

4月22日

星期三

4月20日

星期一
  1. GRASP:面向世界模型的基于梯度的长时程规划方法

    Berkeley AI Research 提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。

4月14日

星期二
  1. Google 推出 Vantage:用生成式 AI 评估未来技能

    Google 发布研究实验 Vantage,通过生成式 AI 构建模拟对话环境,评估高中与大学生的问题解决、协作等未来技能,现已在 Google Labs 开放英文注册。该系统由 Executive LLM 动态引导对话、AI Evaluator 依据评分量表打分,与纽约大学合作对 188 名 18-25 岁美国测试者的研究显示,AI 评分与人类专家评分的一致性接近两位人类专家之间的一致性。

4月9日

星期四