GPT 6.1 Sol:以五分之一价格实现接近 Astra 的智能水平
Simon Willison 发文点评 GPT 6.1 Sol,称其以五分之一的价格提供接近 Astra 的智能水平。该文于 2026 年 9 月 29 日发布,归入 OpenAI、生成式 AI、LLM 与 GPT 等标签。
Simon Willison 发文点评 GPT 6.1 Sol,称其以五分之一的价格提供接近 Astra 的智能水平。该文于 2026 年 9 月 29 日发布,归入 OpenAI、生成式 AI、LLM 与 GPT 等标签。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和办公任务上接近因安全问题推迟发布的旗舰 GPT-6.1 Astra,成本约为后者的五分之一。
Anthropic 发布中端模型 Sonnet 5.5,称其比前代 Sonnet 5 快 30%,token 消耗速度明显更慢,定位为日常任务助手,覆盖编码和办公文档生成。
OpenAI 在 DevDay 上发布 GPT-6.1 Sol,称其在智能体编码、计算机操作和专业工作上接近 GPT-6 Astra 的水平,而标准输入输出 token 价格仅为后者的五分之一。
NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可单次前向传播预测新行标签,无需训练、调参和特征工程,覆盖分类与回归。模型提供 28M 到 215M 三种规模,仅用人工合成表格预训练,采用 OpenMDW-1.1 许可可商用,在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准上排名第一。
ElevenLabs 发布 Eleven v4 语音模型,能更准确地遵循脚本中的情绪、停顿和音效标签,并在长篇制作中保持音色一致。新架构同时用于 Turbo 版本,官方测试中约 150 毫秒开始输出语音,对比 Cartesia Sonic 3.6 的 262 毫秒和 OpenAI GPT-4o mini TTS 的 814 毫秒。
OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景。该模型的 API 输入与输出 token 价格为 Astra 标准价格的五分之一。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于 Sonnet 5。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
Anthropic 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,输出生成速度提升超过 30%,每任务成本最多降低 30%,在多项基准上接近 Opus 5.5。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 和 35B-A3B MoE 两个尺寸,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,形成能听、能看、能说的动态视觉形象,即日起在 Gemini Enterprise 上线。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,通过投机解码在不改变输出质量的前提下提速,端侧解码最高 3.13x、H100 上最高 2.66x,端到端最高 2.62x 和 2.27x。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作,两者在能力与成本上有不同的平衡取向。
小米发布 MiMo-V2.6 系列,包含全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,并推出输出速度最高提升 20 倍的 MiMo-V2.6-Pro-UltraSpeed。
TypeSafe AI 上周发布 Jev,称其为“System One 模型”这一新类别模型的首个实例,作者更认同“决策模型”这一叫法。Jev 接受文本输入,输出的是对应类别、是/否问题、评分的浮点数及置信度,只按输入计费,首个模型输入价格为每百万 token 0.042 美元。作者认为它适合分类任务,如垃圾邮件检测、打标签、排序,也尝试用于搜索重排,并指出它不擅长数字、日期和对抗性内容。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模与成本效率,后者面向高复杂度任务与多步推理。
OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话,并带来更强的指令遵循、自定义音色和电话(telephony)支持。
OpenAI 发布 GPT-6 Astra,称其为面向企业场景能力最强的模型,具备高级推理、计算机操作能力,并在写作与设计判断上更强。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,直接学习实时对地静止卫星数据,每小时生成一次预报,关键地表变量分辨率达 5 公里,整体比 WeatherNext 2 清晰约五倍。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个规模,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,从零以掩码离散扩散目标训练,不依赖预训练视觉塔或因果语言模型。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,前者面向长时程编码与自主智能体,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
Google Research 发布 TimesFM-3,这是其首个原生预训练支持多变量预测的时间序列基础模型,参数量 3.3 亿,预训练语料超过 1 万亿个时间点。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理分析算力需求,并采用 Apache 2.0 开源。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来更可控的生成视频能力,通过 Gemini API 在 Google AI Studio 提供。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文本模型,可直接把原始音频转成准确、经过格式化的文本。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密、仅解码器的推理模型家族,包含 3B、8B、30B 三个尺寸,均以 Apache 2.0 许可开源。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
Google DeepMind 发布多语言手语转文本模型 SL2T,首次把该能力带入消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,主打本地智能体用例,如编码、文档分析和个人助手。
Google DeepMind 发布 WeatherNext AI 模型,在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天预警时间,相当于气象领域约十年的进展。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写出策略即可返回校准后的安全分数,无需重新训练,统一处理文本与图像。官方称其在文本安全上可匹配最高 7 倍参数量的模型,并在多模态审核基准上取得新的最优结果。
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,支持视频理解、多步任务编排与多机器人协作,并可将动作执行交给底层 VLA 模型。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升,包括更复杂自然的旋律结构、提示词遵循与结构感知更好的歌词、更具情感表现力和发音更准确的人声,以及对输出节奏和时长的更易控制。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人智能层,首次实现对完整人形机器人的全身控制,并支持双手与夹爪的精细操作。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,通过 FlashDreams 推理库在单张 NVIDIA RTX PRO 6000 GPU 上运行,支持人与策略闭环交互控制。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber 三款新模型。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。