Google 发布 Gemini 4 Argon,称其为迄今最强模型
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全训练,能自主发现、验证和修补关键软件漏洞。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络安全训练,能自主发现、验证和修补关键软件漏洞。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御方开放,后续将面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
Condé Nast 与 AWS 生成式 AI 创新中心(GenAIIC)合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,并选用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献和实验人员的交互式 harness 组成。
前 Yahoo CEO Marissa Mayer 推出个人 AI 助手 Dazzle,它不读取邮件和日历,只通过分析手机相机胶卷来理解用户的爱好、饮食与风格偏好。
AMD 以 82 亿美元收购 World Labs。World Labs 自 2024 年成立以来构建了图像、视频和空间重建的模型训练团队,并通过收购 SceniX 推进机器人仿真能力。其近期发布的 Atlas 是一种 omni 模型架构,可从 2D 图像输入预测新视角,结合生成模型与多视图几何,解决了计算机视觉中长期存在的稀疏重建问题,在机器人、设计、工程和科学等领域有直接应用。
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成讲解视频上表现突出。
AMD 宣布以约 82 亿美元全股票交易收购李飞飞联合创办的 AI 研究实验室 World Labs,交易预计年底前完成。World Labs 于 2024 年成立,数月内估值达 10 亿美元,2025 年推出首个商业产品 Marble,可根据提示词生成可交互 3D 世界。
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来聚焦下一代 AI 模型与智能体系统、领域 AI、AI 原生研究实践及生态人才四大方向。实验室与新加坡医疗生态合作探索多模态医疗 AI 与自演化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与交通 AI 高管圆桌会。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行多模态强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
Runway 推出 GWM Worlds 2 研究预览,把高保真视频与音频生成变成实时交互式模拟,并引入 WorldPrompt 这一输入格式,可固定首帧等环境要素并生成带时间戳的事件。
Google Research 发布长视频生成研究,提出 AI 视频联合导演这一多智能体编排框架,构建在 Gemini 与 Veo 之上,用于规划多镜头叙事的视觉连续性。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,形成能听、能看、能说的动态视觉形象,即日起在 Gemini Enterprise 上线。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,通过投机解码在不改变输出质量的前提下提速,端侧解码最高 3.13x、H100 上最高 2.66x,端到端最高 2.62x 和 2.27x。
Meta 在周三发布了一款不带摄像头的 Ray-Ban 眼镜,用户只能通过语音与 Meta 的 AI 交互,同时推出 Ray-Ban 新镜框和更便宜的 Meta 眼镜系列。
Meta 在 Connect 2026 上把 Muse 定位为个人智能体,并围绕它发布硬件与功能更新:Muse 支持语音与实时视频,可后台执行任务,将登陆所有 Meta 眼镜;每台 Muse 拥有独立邮箱地址,Mac 版支持 computer use,连接器平台已有 1500+ 应用。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚 AI 落地进展,新加坡 HTX 正基于 Nemotron 3 Super 与 Nemotron 3 Nano Omni 模型研究公共安全 AI。
小米发布 MiMo-V2.6 系列,包含全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,并推出输出速度最高提升 20 倍的 MiMo-V2.6-Pro-UltraSpeed。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,直接学习实时对地静止卫星数据,每小时生成一次预报,关键地表变量分辨率达 5 公里,整体比 WeatherNext 2 清晰约五倍。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个规模,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,从零以掩码离散扩散目标训练,不依赖预训练视觉塔或因果语言模型。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来更可控的生成视频能力,通过 Gemini API 在 Google AI Studio 提供。
Google 发布研究原型 AgentHands(论文发表于 CHI 2026),可将 LLM 的推理输出映射为 XR 头显中与语音同步的手势动画,让智能体在 3D 空间里指点、演示物体操作。系统包含环境感知、手势事件库、手势嵌入推理与本地同步执行四个模块,支持递指、象形和表达三类手势。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指代效果上有显著提升。
Google Research 提出 PhotoScan,一个可从普通 2D 手机照片估算体脂率、A/G 比值和 V/S 比值的深度学习框架,用于预测胰岛素抵抗。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时段、编码器变体和分辨率,获得 Cloud-Optimized GeoTIFF(COG)格式结果。
微软研究院推出 MindTopo 基准,用于评估多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧保留结构关系时有用,跨多步操作后常改变拓扑或违反任务约束。
Google DeepMind 发布多语言手语转文本模型 SL2T,首次把该能力带入消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可实时进行视频临床问诊,感知非语言线索并引导虚拟体格检查。
微软研究院发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,可同时完成报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。CARE-X 支持生成与双推理两种模式,覆盖病灶有无与否定、定位、多标签分类、导管与管线异常位置检测及 29 个解剖区域定位等任务。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持英语、西班牙语、法语、德语、意大利语、越南语、中文、印地语、日语以及新增的现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,主打本地智能体用例,如编码、文档分析和个人助手。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写出策略即可返回校准后的安全分数,无需重新训练,统一处理文本与图像。官方称其在文本安全上可匹配最高 7 倍参数量的模型,并在多模态审核基准上取得新的最优结果。
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,支持视频理解、多步任务编排与多机器人协作,并可将动作执行交给底层 VLA 模型。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人智能层,首次实现对完整人形机器人的全身控制,并支持双手与夹爪的精细操作。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,通过 FlashDreams 推理库在单张 NVIDIA RTX PRO 6000 GPU 上运行,支持人与策略闭环交互控制。
Google Research 发布研究论文 SymptomAI,用五个不同提问策略的 Gemini Flash 2.0 智能体开展症状问诊与鉴别诊断,共纳入 13917 名受试者。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber 三款新模型。
DharmaOCR 在葡萄牙语 OCR 基准上以 0.925 的得分超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过两阶段训练实现领域专精:先以葡萄牙语语料监督微调,再用 DPO 提升推理稳定性。作者认为,尽管新架构不断涌现,专注单一语言的参数集中策略仍构成结构性优势。
Thinking Machines 在 Hugging Face 发布 Inkling,一个约 1T 参数、支持 1M 上下文、原生接收图像文本音频输入的多模态 MoE 模型,并同步推出 276B 总参数 12B 激活的 Inkling-Small。