Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御方开放,后续将面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御方开放,后续将面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机操作和日常专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上以约五分之一的单任务成本达到 GPT-6 Astra 的水平,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。
OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景。该模型的 API 输入与输出 token 价格为 Astra 标准价格的五分之一。
OpenAI 发布 DevDay 2026 回顾,汇总了 20 多项发布,涉及 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。原文仅给出概览,未展开各项更新的具体细节。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,支持 Responses、Chat Completions 和 Converse API。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
OpenAI 启动 Codex Originals 项目下一阶段,征集使用 Codex 的开发者、研究者与创作者的真实故事和项目。有意参与者可通过下方表单提交自己的经历与项目介绍。
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 构建、运营并销售现代车队管理服务,销售提升 60%,节省 75+ 小时。
GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是打包的团队经验,后者是连接工具与数据的标准接口,二者可组合使用。RAG 并未消亡,它为模型提供训练数据之外的相关信息,与 Agent、Skills、MCP 可共存于同一工作流。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。
Cognition 借助 GPT-6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师减少代码审查、加快交付。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需切换编辑器、终端和浏览器即可完成审查、运行和预览 AI 生成代码的完整闭环。diff 面板以绿色和红色高亮显示新增与删除行,支持接受更改、留言或让 Copilot 继续修改;终端面板可直接运行项目命令并支持多窗口切换;浏览器面板提供 Pick & Polish 工具,可选中页面元素并让智能体调整。
César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 迁移到 C++,对象是一个没有测试套件和集中文档的物理密集型油藏模拟器。团队先搭建数值对齐测试框架,用 Skill.md 引导智能体导出状态快照并校验迁移模块,再用 Vibe CLI 启动上百个智能体解析调用树、结合 Mistral OCR 整理散落文档。
一位 MIT 研究员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。
1Password 的工程师使用 Codex 快速构建新功能和内部工具,在维持严格安全策略的同时达到生产可用状态,工程效率提升 21%。
OpenAI 披露内部数据,展示编码智能体正在重塑 AI 研究,涉及智能体使用情况、实验速度、任务复杂度与研究加速等方面。
GitHub 发布研究预览 Project HydraFusion,通过运行时多模型编排为 Copilot 提供前沿级编码能力,用户可在 GitHub Copilot CLI 中通过 /experimental 启用,费用按各模型实际消耗的 token 标准价计。
GitHub Copilot app 支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文。用户可在 sessions view 中查看各会话标题与任务进度,随时切换并从中断处继续,无需重新说明任务。文中以 tailspin-toys 仓库为例,演示同时进行 funded sort 功能开发、无障碍审查和测试三项任务。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,前者面向长时程编码与自主智能体,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间跨框架迁移企业级 Java 应用的能力。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,同时保持对专有数据和 IP 的控制。
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,覆盖工作与编码两类场景,原有对话、设置和订阅方案全部保留。
Mistral 发布 Mistral Medium 3.5,这是其首个将指令遵循、推理与编码合并的 128B 稠密模型,采用修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管。
Google DeepMind 发布 Gemini 3.5 模型系列,首发 3.5 Flash,主打智能体与编码能力,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。
Google DeepMind 发布 AlphaEvolve 一年进展汇总,这款由 Gemini 驱动的编码智能体已从数学与计算机科学的开放问题扩展到基因组、电网、量子物理和 AI 基础设施等领域。
Mistral AI 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral vibe 与免费 API 端点 labs-leanstral-2603。
Mistral 基于其开源编码助手 Vibe 搭建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试,并在 CI/CD 流程中无需人工干预运行。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。
Mistral AI 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
Mistral AI 发布 Codestral 25.08,并推出面向企业的完整编码栈,包含 Codestral、Codestral Embed、Devstral 与 Mistral Code IDE 插件。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
Mistral 发布 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量和本地气隙 GPU 部署,代码留在企业边界内。
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,在真实代码检索任务上表现优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源。