Dwarkesh 对 Computer Use 的判断错在哪,以及 OpenAI 如何一周内做出 Jev 竞品
Latent Space 在 OpenAI DevDay 后访谈了负责 Computer Use 产品与工程的 Ari Weinstein 和 OpenAI API 产品负责人 Nikunj Handa。
Latent Space 在 OpenAI DevDay 后访谈了负责 Computer Use 产品与工程的 Ari Weinstein 和 OpenAI API 产品负责人 Nikunj Handa。
Amazon Bedrock Knowledge Bases 新增 AgenticRetrieveStream API,可将多部分理赔问题拆成子查询并多轮检索,直到证据充分再生成带引用的回答。
AWS 官方博客演示在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲智能体用 Claude Sonnet 4.6 生成音乐简报并在实例的 NVIDIA L4 上运行 ACE-Step 渲染音频,交付智能体读取共享卷上的 .wav 做测量与 DSP 处理,合规智能体独立复测并筛查与曲库的谐波相似度。
TechCrunch 分析称,OpenAI 在 Dev Day 发布的 Dots 智能体、新模型及 ChatGPT 应用内建议、插件扩展等多项功能,共同指向对传统应用商店模式的冲击。
Shopify 宣布浏览器端 AI 智能体现在可以在其商户站点完成购买,能力从搜索商品和加入购物车延伸到结账环节。该功能基于 WebMCP 并覆盖 Shop Pay,智能体可读取和更新结账页面,并在买家授权后提交交易,无需依赖截图或抓取网页。
OpenAI 在周二的 Dev Day 上宣布扩展 ChatGPT 插件,开发者可构建类应用体验,插件在 ChatGPT 侧边栏获得专属入口,并支持可交互面板和文件查看器。
OpenAI 在 DevDay 宣布一批 ChatGPT 更新,包括开放的插件系统 Plugin Extensions、共享工作空间 Space、协作文档 Pages 与 Slides、Slack 和 Microsoft Teams 集成、自动工作流以及企业市场。
曾让用户用提示词构建应用的 AI 初创公司 Wabi 转向即时通讯体验,推出 Wabi 2.0,定位为"为你做事、并即时构建所需界面的个人智能体"。用户可在对话中按需生成卡路里追踪、举重记录等应用,目前仅通过邀请码在 X 上发放。
OpenAI 在 DevDay 2026 开发者大会上发布常驻智能体 Dots,可自行接手修复 Slack 中报告的 bug、发送被遗忘的发票等任务,同时推出更便宜的 GPT-6.1 Sol,旗舰 GPT-6.1 Astra 因安全问题暂缓发布。
Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,官方发布两部分系列的第一部分,聚焦跨组件通用的提示词原则与可复用框架。文章给出 CRISPE 框架,涵盖上下文与约束、角色与职责、意图与输入、步骤与范围等要素,并强调具体化、业务上下文和示例示范优于抽象描述。
AWS 发文拆解 Amazon Quick 各组件的提示词写法:Quick Research 需明确目标、受众与时间范围,并自行拆解子问题、限定数据源(Quick Index。
Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可保留工具输出的来源身份,检测"事实为真但归属错误"的跨来源混淆。在医疗智能体的 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种核查器的对比中得分最高。
Manus 发布 2.0 版本,把 AI 智能体扩展为平台,支持视频剪辑、托管多人游戏,以及用手机号运行个人智能体并从手机远程操控。测试配置中,新的 Cascade 智能体框架比上一代系统少用 23.2% 的 token,运行成本降低 32%。
Anthropic 的 Thariq Shihipar 在 Latent Space 播客中谈 Claude Code 的下一阶段,包括 Ask User Question、artifacts、Claude Tag、Projects 以及可自定义 harness 的 Claude Mods。
基于 Amazon Nova Act 与 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本,由多模态 LLM 读取 UI 截图执行登录、下单、结账等关键流程。
Simon Willison 用 Opus 5.5 编写了一款 Bluesky 回复机器人检测工具,可分析任意 Bluesky 账号是否存在自动回复机器人迹象。该工具检测的信号包括:在其他账号发帖后数秒内回复、从不发布原创内容或图片链接而只回复高粉丝量用户,以及回复中出现问号。Bluesky 仍提供免费可用的 API,使这类调查比在 Twitter 上更可行。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,即可生成看板、发布清单或仪表盘等界面,无需编写代码。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区也已通过 Awesome Copilot 分享现成模板。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就能识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分类并生成漏洞报告。
企业可用 Amazon Bedrock AgentCore Gateway 与 MCP 构建多账户 AI 智能体架构,让各业务线数据留在自己的 AWS 账户内,仅在查询时按需流出。
Aderant 基于 Amazon Bedrock 调用 Amazon Nova Lite,为 38 人的 SierraOps 团队构建了智能工单分析器,自动完成工单上下文收集、分类与路由。
荷兰零售商 HEMA 基于 MCP 和 Amazon Bedrock AgentCore 构建了内部 AI 助手 HAL,把原本分散在多个门户和 wiki 中的知识集中到一处,并直接送进 Kiro、Claude 等团队日常使用的工具中。
Simon Willison 发布 LLM 插件 llm-typesafe 0.1a0,为 LLM 工具接入 TypeSafe AI 的新模型 Jev。
Simon Willison 反驳了“MCP 已是坏主意”的观点,认为在 Claude Code、Codex 等拥有无限制互联网访问的终端智能体之外,MCP 仍有不可替代的价值。他指出,若想限制智能体可访问的外部服务、避免其直接接触 API key、提供用户连接与认证的 UI,以及实现强审计日志,MCP 让这些能力更容易提供。仅因完整编码智能体不需要 MCP 就认定其过时,会忽略其他可构建的场景。
Simon Willison 发布 llm-keys-ui 0.1,这是一个解决在远程机器上配置 API key 问题的插件。用户可通过 `uvx --with llm-keys-ui llm keys-ui --all` 启动一个界面,在本地网络或 Tailscale 设备 IP 上保存 API key,避免将密钥直接粘贴进 ChatGPT 应用或 agent 会话。
Latent Space 的 AINews 汇总称,Jev 发布两天内其发布视频获得 3600 万次观看,并已出现至少 6 个复现或类似方案,包括基于 ModernBERT 的 Laya、基于扩散模型的 DiffusionGemmaJev、Qwen3.5-9B LoRA 微调的 Bespoke Nimble、SemIf、Jevlike 和 Kev-0.5B。
GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是打包的团队经验,后者是连接工具与数据的标准接口,二者可组合使用。RAG 并未消亡,它为模型提供训练数据之外的相关信息,与 Agent、Skills、MCP 可共存于同一工作流。
Google Research 在 ACL 2026 提出 ToolGrad,采用“先答案后问题”范式,先生成真实工具调用链再反推用户查询,替代传统 DFS 试错式标注。
Hugging Face 团队用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张画布 Workflow1111,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 与图生视频。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供持久记忆层,从本机已有会话构建索引,默认在本地完成嵌入与重排。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、仅解码器的推理模型家族,包含 3B、8B、30B 三个尺寸,均以 Apache 2.0 许可开源。
Hugging Face 在 Gradio 中推出 gr.Workflow,把多步 AI 管线描述为带类型节点的图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检视并核实信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。
Mistral Studio 现已向客户提供 Prompts 和 Skills 的集中管理系统,每个资产都具备版本记录、明确归属和可追溯性。不可变版本、回滚、分类标签和审计日志等功能让 AI 行为可治理、可发现,并通过 Observability 将生产输出追溯至对应版本。Skills 可作为 MCP 服务器直接从 Studio 调用,确保生产执行的是同一受治理资产。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它仅以独立的 Gemini 2.5 computer use 模型形式提供。
Mistral AI 为 Connectors 推出多项新能力:按 workspace 或组织设置连接器访问权限、开关单个工具的管理员控制已 GA,带连接器作用域的 API key 已 GA。
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,覆盖工作与编码两类场景,原有对话、设置和订阅方案全部保留。
Mistral AI 发布 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合框架,把摄取、检索和评估整合到共享接口的单一框架中,开源且可部署在云、本地或边缘。
Mistral 在 Studio 发布 Connectors,内置连接器与自定义 MCP 均可通过 API/SDK 用于所有模型和智能体调用,目前处于 Public Preview。
Mistral AI 发布 Workflows 公开预览,定位为企业 AI 的编排层,提供持久执行、可观测性和容错能力,用于把 AI 流程从概念验证推进到生产。