Anthropic 发布 Sonnet 5.5,称比前代快 30% 且更省
Anthropic 发布中端模型 Sonnet 5.5,称其比前代快 30%、成本显著更低且 token 消耗明显更慢,适合编程和制作办公文档等日常任务。前代 Sonnet 5 约三个月前发布,卖点是低成本运行智能体;官方基准显示 5.5 在智能体编码上优于 Opus 5.5,可能因为能拉起多个智能体而不超出成本限制。
Anthropic 发布中端模型 Sonnet 5.5,称其比前代快 30%、成本显著更低且 token 消耗明显更慢,适合编程和制作办公文档等日常任务。前代 Sonnet 5 约三个月前发布,卖点是低成本运行智能体;官方基准显示 5.5 在智能体编码上优于 Opus 5.5,可能因为能拉起多个智能体而不超出成本限制。
Claude Opus 5.5 本周发布,社区反响一边倒地正面,并占据讲解视频时间线。它以 88.4% 领先 SimpleBench。视觉评测中,有评测者将其列为 Anthropic 迄今最好的视觉模型,优于 Fable 5 与 GPT-6 Sol、不及 GPT-6 Astra,成本约比 Fable 5.1 低 60%。
Anthropic 今天发布 Claude Sonnet 5.5,称其运行快 30% 以上、多数工作成本最多降 30%,定价与 Sonnet 5 相同,作者认为它在各项基准上似乎都更高。
Claude Sonnet 5.5 今日登陆 Amazon Bedrock,Claude Platform on AWS 在北美提供。它适合范围明确的编码与知识工作,多数工作的单任务成本更低、速度更快。数据留在 AWS 内并支持区域数据驻留,可配合 IAM 与 Amazon Bedrock Guardrails。
Anthropic的Claude Sonnet 5.5接近Opus 5.5多项基准表现,生成速度超过30%,单任务成本最多降30%。
推荐理由:Sonnet 5.5在与前代相同的百万 token 价格下最多降低三成单任务成本,多项基准则接近 Opus 5.5。
H 公司发布智能体模型系列 Holo4,提供 27B 稠密与 35B-A3B Mixture of Experts 两个尺寸,并推出 Holotron4 Nano。
推荐理由:同一模型同时覆盖屏幕操作、代码执行和工具调用,公开轨迹则让桌面长流程上的成本与得分可以直接对照。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,用投机解码加速推理且输出质量不变。设备端解码最高 3.13x、H100 最高 2.66x,端到端最高 2.62x 与 2.27x,参数多 280M(8.9%)。首日支持 llama.cpp、MLX-VLM、SGLang,提供开放权重。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,前者侧重用自然语言从零设计角色声线,后者面向高用量、低成本的配音与语音代理。
推荐理由:Gemini 3.8 的两款新语音模型可用自然语言设计角色声线,并公开基准名次与各端入口,方便对照现有配音和语音代理流程。
Anthropic称Opus 5.5在默认设置的典型工作负载上相比Opus 5节省接近40%,因为token成本下降,且完成任务所用token更少。Opus 5.5在网络安全和生物学等高风险领域能力突出,将沿用Fable 5.1的保护,被标记的请求可能被自动且透明地路由到更旧模型。
Google DeepMind发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,把近实时推理用于语音智能体。
推荐理由:原文给出了Extended Thinking的语音基准分数,以及两款模型面向开发者、企业和普通用户的不同开放范围。
Google DeepMind与Google Research发布WeatherNext 3,可每小时生成最高5公里分辨率的全球天气预报。相较25公里网格、6小时更新的WeatherNext 2,新模型的全球天气画面约锐利5倍;中期预报早期时效的CRPS相对IMERG最高改善60%,相对MRMS为30%,相对雨量计为10%。
推荐理由:WeatherNext 3将WeatherNext 2的25公里、6小时改为5公里与每小时更新,并接入Search、Gemini和Maps。
NeoMME推出260M和800M两款多语言多模态编码器,单一双向Transformer从零处理文本token与32×32图像块,并用掩码离散扩散目标训练全模型。
Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。3.8 Flash 沿用 3.7 Flash 的入门价格,输入每百万 token 为 $0.75、输出每百万 token 为 $3.75,并提升软件工程、智能体任务与多步推理,HLE-Verified 达到 54.9%。
推荐理由:3.8 Flash以与3.7相同的价格加强长程编码和多步推理,网络安全变体仅经Fairwind向政府、关键基础设施和软件维护方开放。
Google Research 推出时间序列基础模型 TimesFM-3,参数量为 330 million,预训练数据超过 1 万亿个时间点,可在单次前向中零样本联合预测多条序列。
Gemini Omni 1.1 Flash 现已推出,开发者可通过 Gemini API 做场景延续、首尾帧插值和最高 4K 放大。场景延续能分析最多 10 秒前文,而不只参考最后 1 秒,并按 10 秒一段把视频延到累计 40 秒;360p 预览成本为标准 720p 的三分之一,生成最高快 60%,成片可输出 1080p 或 4K。
推荐理由:开发者现在可以用最多10秒前文把已有视频按10秒一段延续到累计40秒,再以360p三分之一的成本和最高快60%的速度试稿后放大到4K。
Google 发布语音转文字模型 Gemini 3.5 Transcribe,可将原始音频直接转为准确、润色并自动排版的文本,并称这是其迄今最精确的语音转写模型。
推荐理由:相对 Chirp 3,新模型给出流式 4.0% 与非流式 2.6% 词错误率以及终稿时间改善 70% 的直接对比。
Granite 4.2从Granite-4.1基座出发,经监督微调和多阶段GRPO强化学习,得到3B、8B、30B三款稠密仅解码器推理模型。监督微调约用7.2 million条样本(约100B token,其中约65B可训练);基座则以约15T token分五阶段从零预训练,并把上下文扩到512K。
推荐理由:技术文按监督微调、GRPO与分阶段课程写清Granite 4.2的训练路径,并写明只有8B和30B做真实环境里的智能体训练。
Liquid AI 发布三款 LFM2.5 的 DSpark 草稿模型,在不改变贪心输出的前提下,把 GPU 吞吐最高做到 3.18 倍、端侧最高做到 2.87 倍。
Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体,距 3.6 Flash 仅三周,入门价为原先每百万 token 成本的一半。
推荐理由:Gemini 3.7 Flash 在 3.6 Flash 发布仅三周后推出,编码调试、网页生成和复杂文档处理基准均有提升,同时入门价定为原先每百万 token 成本的一半。
Google DeepMind发布大规模多语言手语转文本模型SL2T,先在Pixel 11的Gboard和Live Transcribe中把美国手语译成英语听写。
推荐理由:SL2T把超过五十种手语的身体关键点直接译成流式文本,并开始用于Pixel 11听写,读者可以据此了解手语输入如何接进日常打字。
Google DeepMind 的 WeatherNext 在 Nature 论文中显示,气旋路径、强度和风场的三天预报平均达到以往模型两天的水平。该模型用近 20TB 全球大气数据与 IBTrACS 中近 5000 场历史风暴联合训练,今年把集合规模扩至 1000 个成员,可在 TPU 上不到一分钟生成 15 天预报。
推荐理由:三天气旋预报达到以往模型两天的水平,并开源 WeatherNext 2 与气旋模型,预报流程因此多出约一天可准备的时间。
Mistral 以 Apache 2.0 发布 3B 开源权重多模态安全分类器 Shieldstral,把内容审核做成推理时可用自然语言政策作答的二分类问答。请求包含评估说明、是否类问题和待审内容,模型只读取 yes 与 no 的 logits,经 softmax 得到连续安全分数,同一接口覆盖提示、回复、提示与回复组合以及图像。
Google DeepMind 今天发布 Gemini Robotics ER 2,将其作为机器人的高层具身推理模型,用于对话、理解物理世界和多步规划,再把运动执行交给下层视觉语言动作模型。
推荐理由:新模型相对 ER 1.6 补上了连续视频中的进度判断与多机协作能力,开发者可把它接到下层动作模型来编排多步实体任务。
Google DeepMind 今日在 Google Flow Music 推出 Lyria 3.5,提升音乐性、歌词、人声质量与创作控制。作为最新音乐生成模型,它能帮助用户做出更丰富的曲目。
Google DeepMind 推出 Gemini Robotics 2,把视觉和语言输入转成电机控制,让完整人形机器人和双臂机器人完成从脚到指尖的全身动作与灵巧操作。
推荐理由:这次更新把原先的桌面上半身操作扩展到全身协调、灵巧操作和多机协作,并说明端侧模型可用数小时数据适配新机体。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber,用于以更高 token 效率、更低延迟和更可靠表现规模化构建 AI 智能体。
推荐理由:官方把三款新模型相对前代的token用量、速度、价格和基准分数放在一起,便于比较它们在智能体工作流里的成本与能力取舍。
Google 推出 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证并修补漏洞,并在这些任务上比主线 Flash 模型更有效。
Mistral 发布 8B 模型 Robostral Navigate,仅凭单目 RGB 相机和自然语言指令让机器人自主导航,在 R2R-CE 验证集未见环境达到 76.6% 成功率。
Mistral发布Apache-2.0免费模型Leanstral 1.5,总参数119B、激活参数6B,在miniF2F验证集与测试集均达到100%,并解出PutnamBench 672题中的587题。
推荐理由:原文给出6B激活参数模型的基准成绩、约4美元单题成本和开源入口,读者可以据此比较它与更高成本形式验证系统的差异。
Google DeepMind 开放 Nano Banana 2 Lite 与 Gemini Omni Flash,分别用于高速图像生成,以及视频生成和对话式编辑。
推荐理由:官方同时给出图像模型的延迟与单价,以及视频模型的按秒定价和时长限制,读者可以据此估算图生视频迭代的成本。
Google Research 推出零样本表格基础模型 TabFM,一次前向即可对未见过的表做分类和回归,无需逐表训练、调参和特征工程。它把整张表当作统一提示,用行列交替注意力、行压缩和 Transformer 做上下文学习,全部基于数亿个结构因果模型合成的数据集预训练。
推荐理由:把表格预测改写成上下文学习之后,读者可以对照传统树模型流程判断单次前向能否省掉调参和特征工程。
Mistral 发布 Mistral OCR 4,在提取文本之外返回边界框、类型化块分类和行内置信度,支持 10 个语系共 170 种语言,并可在单个容器中完全自托管。
推荐理由:官方说明 Mistral OCR 4 在文本之外返回边界框、块分类和置信度,并公布人工评测胜率与基准分数,便于评估其进入检索和自托管流水线的条件。
Google DeepMind发布实验性开源模型DiffusionGemma,这款26B MoE以文本扩散整块并行生成文本,在专用GPU上最高可实现4倍加速。
推荐理由:DiffusionGemma把本地文本生成从逐token解码改成整段并行起草,并交代相对Gemma 4的速度、显存和质量取舍,便于判断它适合哪些交互式本地工作流。
Google 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70 多种语言,并近实时生成保留语调、节奏和音高的语音翻译。
推荐理由:相比轮次等待后再译,Gemini 3.5 Live Translate 会持续出声并落后说话人仅几秒,读者可据此了解它进入翻译应用、Meet 和开发接口后的实时互译方式。