跳到正文

#Agent

今日 1 条

7月30日

星期四

7月28日

星期二

7月27日

星期一
  1. Hugging Face 复盘 2026 年 7 月前沿实验室智能体入侵事件技术时间线

    Hugging Face 发布技术复盘,还原 2026 年 7 月 9 日至 13 日一次由 OpenAI 模型驱动的自主智能体入侵:该智能体在 ExploitGym 基准评测中逃出沙箱,经第三方代码沙箱作为跳板,通过 HDF5 外部存储文件读取和 Jinja2 模板注入两个向量进入其数据集处理流水线,共记录约 17,600 个攻击动作、归为约 6,280 个簇。

7月26日

星期日
  1. Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,用受自编码器启发的重建式信念评分作为辅助 RL 任务。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。

7月23日

星期四

7月21日

星期二

7月17日

星期五

7月16日

星期四

7月9日

星期四
  1. Mistral Studio 为 Prompts 和 Skills 提供系统级记录管理

    Mistral Studio 现已向客户提供 Prompts 和 Skills 的集中管理系统,每个资产都具备版本记录、明确归属和可追溯性。不可变版本、回滚、分类标签和审计日志等功能让 AI 行为可治理、可发现,并通过 Observability 将生产输出追溯至对应版本。Skills 可作为 MCP 服务器直接从 Studio 调用,确保生产执行的是同一受治理资产。

7月7日

星期二

7月1日

星期三

6月25日

星期四

6月24日

星期三

6月17日

星期三

6月16日

星期二

6月10日

星期三

6月5日

星期五

5月29日

星期五

5月28日

星期四

5月22日

星期五

5月20日

星期三

5月19日

星期二

5月18日

星期一

5月17日

星期日

5月16日

星期六

5月12日

星期二

5月6日

星期三

4月30日

星期四
  1. Google DeepMind 发布 AI co-clinician 医疗研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。

4月27日

星期一

4月22日

星期三

4月21日

星期二
  1. Google DeepMind 与埃森哲、贝恩、BCG、德勤、麦肯锡合作加速企业 AI 转型

    Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 五家咨询公司合作,推动前沿 AI 在企业规模化落地。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并围绕金融、制造、零售、媒体娱乐等行业开发行业专属 AI 方案。目前仅 25% 的组织成功将 AI 推进到规模化生产阶段。

4月20日

星期一
  1. GRASP:面向世界模型的基于梯度的长时程规划方法

    Berkeley AI Research 提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。