Google 发布 Gemini 4 Argon,称其为迄今最强模型
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全训练,能自主发现、验证和修补关键软件漏洞。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全训练,能自主发现、验证和修补关键软件漏洞。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御方开放,后续将面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机操作和日常专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上以约五分之一的单任务成本达到 GPT-6 Astra 的水平,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和办公任务上接近因安全问题推迟发布的旗舰 GPT-6.1 Astra,成本约为后者的五分之一。
Anthropic 发布中端模型 Sonnet 5.5,称其比前代 Sonnet 5 快 30%,token 消耗速度明显更慢,定位为日常任务助手,覆盖编码和办公文档生成。
OpenAI 在 Dev Day 上为软件工程智能体 Codex 推出可复用的云端开发环境,可从电脑、手机或云端访问,让任务启动更快并支持团队共享已批准的设置与权限。
OpenAI 在 DevDay 上发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra 的智能水平,标准输入输出 token 价格仅为后者的五分之一。
OpenAI 在旧金山 DevDay 2026 开发者大会上宣布扩展 Codex 与 API:Codex 新增可复用云环境、仓库安全扫描 Codex Security Cloud、桌面端代码审查视图和重做的 CLI,Agents API 加入 Computer Use、Tool Search 与 Context Compaction。
OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景。该模型的 API 输入与输出 token 价格为 Astra 标准价格的五分之一。
OpenAI 发布 DevDay 2026 回顾,汇总了 20 多项发布,涉及 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。原文仅给出概览,未展开各项更新的具体细节。
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成讲解视频上表现突出。
Anthropic 的 Thariq Shihipar 在 Latent Space 播客中谈 Claude Code 的下一阶段,包括 Ask User Question、artifacts、Claude Tag、Projects 以及可自定义 harness 的 Claude Mods。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,支持 Responses、Chat Completions 和 Converse API。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
Anthropic 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,输出生成速度提升超过 30%,每任务成本最多降低 30%,在多项基准上接近 Opus 5.5。
OpenAI 启动 Codex Originals 项目下一阶段,征集使用 Codex 的开发者、研究者与创作者的真实故事和项目。有意参与者可通过下方表单提交自己的经历与项目介绍。
Simon Willison 在 WeAreDevelopers World Congress North America 的主题演讲中,按时间线梳理了 2026 年 LLM 的关键进展。
Simon Willison 用 Claude Opus 5.5 将三张 kākāpō 鹦鹉照片生成 HTML5 canvas 像素动画 Kākāpō Party,画面中至少 20 只鹦鹉随音乐跳跃、撒彩带。
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 构建、运营并销售现代车队管理服务,销售提升 60%,节省 75+ 小时。
Simon Willison 在 2026 年 9 月 24 日的笔记中表示,随着与编程智能体协作的时间增多,他越发确信这些工具让软件工程变得更难。他认为编程智能体能做出惊人的成果,但释放其全部潜力需要极高的纪律性和知识储备。
Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。
Simon Willison 与 Jesse Vincent 将于 10 月 14 日(周三)在旧金山举办一场面向 coding agent 构建者的晚间交流活动,形式为非正式的 agentic show-and-tell。活动鼓励参与者分享尚未公开的尝试、奇怪实验和未完成项目,无需正式演讲,也不是产品推介。
一位入职大公司半个月的工程师称,团队里的规格、代码、测试、PRD、工单及其处理、报告等全部由 Claude Code 生成,团队中没有人喜欢这种方式,但被要求尽可能多地交付。他表示从高层多次听到推送代码不是瓶颈,人们每天工作 12 到 13 个小时只是为了按回车,从 L1 到 L7 的工程师都在做同样的事,没有人阅读任何内容。
Latent Space 的 AINews 汇总称,Jev 发布两天内其发布视频获得 3600 万次观看,并已出现至少 6 个复现或类似方案,包括基于 ModernBERT 的 Laya、基于扩散模型的 DiffusionGemmaJev、Qwen3.5-9B LoRA 微调的 Bespoke Nimble、SemIf、Jevlike 和 Kev-0.5B。
GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是打包的团队经验,后者是连接工具与数据的标准接口,二者可组合使用。RAG 并未消亡,它为模型提供训练数据之外的相关信息,与 Agent、Skills、MCP 可共存于同一工作流。
Latent Space 的 AINews 汇总 9 月 15 至 16 日 AI 动态,其中两个案例构成对编码智能体乐观预期的现实检验。Steve Yegge 关停 Gas Town,并承认尽管每月在编码智能体订阅上花费数千美元,实际只用它做出了 Gas Town 这一个项目。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。
Cognition 借助 GPT-6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师减少代码审查、加快交付。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需切换编辑器、终端和浏览器即可完成审查、运行和预览 AI 生成代码的完整闭环。diff 面板以绿色和红色高亮显示新增与删除行,支持接受更改、留言或让 Copilot 继续修改;终端面板可直接运行项目命令并支持多窗口切换;浏览器面板提供 Pick & Polish 工具,可选中页面元素并让智能体调整。
César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 迁移到 C++,对象是一个没有测试套件和集中文档的物理密集型油藏模拟器。团队先搭建数值对齐测试框架,用 Skill.md 引导智能体导出状态快照并校验迁移模块,再用 Vibe CLI 启动上百个智能体解析调用树、结合 Mistral OCR 整理散落文档。
一位 MIT 研究员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。
1Password 的工程师使用 Codex 快速构建新功能和内部工具,在维持严格安全策略的同时达到生产可用状态,工程效率提升 21%。
OpenAI 披露内部数据,展示编码智能体正在重塑 AI 研究,涉及智能体使用情况、实验速度、任务复杂度与研究加速等方面。
GitHub 发布研究预览 Project HydraFusion,通过运行时多模型编排为 Copilot 提供前沿级编码能力,用户可在 GitHub Copilot CLI 中通过 /experimental 启用,费用按各模型实际消耗的 token 标准价计。
GitHub Copilot app 支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文。用户可在 sessions view 中查看各会话标题与任务进度,随时切换并从中断处继续,无需重新说明任务。文中以 tailspin-toys 仓库为例,演示同时进行 funded sort 功能开发、无障碍审查和测试三项任务。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,前者面向长时程编码与自主智能体,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
Epoch 与 METR 发布 MirrorCode 基准,用于测试 AI 系统完成人类需长时间投入的编程任务的能力,该基准 4 月首次公布,此次补充测试后正式发布。