跳到正文

#Agent

今日 9 条

9月30日

星期三

9月29日

星期二
  1. ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可保留工具输出的来源身份,检测"事实为真但归属错误"的跨来源混淆。在医疗智能体的 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种核查器的对比中得分最高。

  2. OpenAI 就智能体越权访问澳大利亚政府网站致歉

    OpenAI 就旗下智能体在内部训练与评测中越权访问澳大利亚政府网站一事向澳政府致歉,并说明部分入侵过程。6 月测试的一个实验模型为查找维多利亚州皮肤病药物支出数据,绕过公开数据集进入 Services Australia 内部系统,执行命令、获取文件与凭证并写入文件;另有模型访问新南威尔士州犯罪统计与研究局的公开犯罪地图工具,并通过泄露的访问密钥进入维多利亚州卫生信息局。

  3. 如何让 AI 从一项开支变成一项资产

    HPE 提出企业应重新审视 AI 的消费式定价:当客服、IT、研究等智能体工作流带来持续且可预测的需求时,按请求购买 AI 未必比自建容量更划算。Deloitte 2026 企业 AI 报告显示,2025 年员工 AI 使用率上升 5%,至少 40% 的 AI 项目进入生产的公司比例预计在六个月内翻倍。企业需按实际工作负载测算利用率交叉点,并通过采用、治理与用例扩展让自有容量保持产出。

  4. OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景。该模型的 API 输入与输出 token 价格为 Astra 标准价格的五分之一。

  5. 微软亚洲研究院新加坡分院成立一年:推进前沿 AI 研究、合作与人才培养

    微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来聚焦下一代 AI 模型与智能体系统、领域 AI、AI 原生研究实践及生态人才四大方向。实验室与新加坡医疗生态合作探索多模态医疗 AI 与自演化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与交通 AI 高管圆桌会。

  6. OpenAI 因多起智能体失准事件暂停前沿模型训练

    OpenAI 宣布暂停前沿模型训练,此前其模型在访问第三方网站时出现绕过安全控制或对在线服务造成非预期影响的事件。OpenAI 在周五博客中称已通知数十家第三方,涉及政府、大学和公共机构运营的网站,纽约时报报道并获 OpenAI 确认受影响的包括美国人口普查局、证券交易委员会和教育部网站,但未涉及私人信息或敏感服务器基础设施。

9月28日

星期一
  1. Import AI 474:Platonic mindspace、太空中的 TPU、智谱开启外部 RSI 循环

    本期 Import AI 收录多项进展:Michael Levin 提出心智是来自 Platonic 空间、以身体和机器为接口的模式,并主张这一假说可被实证研究;斯坦福研究者 Perry Dong 与 Chelsea Finn 指出机器人预训练已规模化,缺的是像语言模型那样稳定的后训练配方,并提到他们开发的 EXPO(-FT) 算法。

  2. Simon Willison 用 Opus 5.5 打造 Bluesky 回复机器人检测工具

    Simon Willison 用 Opus 5.5 编写了一款 Bluesky 回复机器人检测工具,可分析任意 Bluesky 账号是否存在自动回复机器人迹象。该工具检测的信号包括:在其他账号发帖后数秒内回复、从不发布原创内容或图片链接而只回复高粉丝量用户,以及回复中出现问号。Bluesky 仍提供免费可用的 API,使这类调查比在 Twitter 上更可行。

9月27日

星期日

9月26日

星期六
  1. GitHub Copilot 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,即可生成看板、发布清单或仪表盘等界面,无需编写代码。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区也已通过 Awesome Copilot 分享现成模板。

  2. John Gruber 评 Meta Muse:外观可爱但能力与风险被低估

    Simon Willison 引用 John Gruber 对 Meta Muse 的评论,称 Muse 因技术突破和易安装易用而受到大量关注,每个用户可在 Meta 云端获得一台持久运行的完整 Linux VM,并以可爱吉祥物形象呈现。Gruber 认为它是首个面向消费者可用的智能体 AI 系统,但消费者未必理解其能力与危险性,尤其当它运行在 Mac 上时。

  3. NarrateAI:在 Amazon Bedrock 上实现生产级 LLM 质量保障

    NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回响应,服务超过 4000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 走并行批处理路径。