H 公司发布通用计算机使用模型 Holo4,含 27B 与 35B-A3B
H 公司发布智能体模型系列 Holo4,提供 27B 稠密与 35B-A3B Mixture of Experts 两个尺寸,并推出 Holotron4 Nano。
推荐理由:同一模型同时覆盖屏幕操作、代码执行和工具调用,公开轨迹则让桌面长流程上的成本与得分可以直接对照。
H 公司发布智能体模型系列 Holo4,提供 27B 稠密与 35B-A3B Mixture of Experts 两个尺寸,并推出 Holotron4 Nano。
推荐理由:同一模型同时覆盖屏幕操作、代码执行和工具调用,公开轨迹则让桌面长流程上的成本与得分可以直接对照。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,用投机解码加速推理且输出质量不变。设备端解码最高 3.13x、H100 最高 2.66x,端到端最高 2.62x 与 2.27x,参数多 280M(8.9%)。首日支持 llama.cpp、MLX-VLM、SGLang,提供开放权重。
NeoMME推出260M和800M两款多语言多模态编码器,单一双向Transformer从零处理文本token与32×32图像块,并用掩码离散扩散目标训练全模型。
Google Research 推出时间序列基础模型 TimesFM-3,参数量为 330 million,预训练数据超过 1 万亿个时间点,可在单次前向中零样本联合预测多条序列。
Granite 4.2从Granite-4.1基座出发,经监督微调和多阶段GRPO强化学习,得到3B、8B、30B三款稠密仅解码器推理模型。监督微调约用7.2 million条样本(约100B token,其中约65B可训练);基座则以约15T token分五阶段从零预训练,并把上下文扩到512K。
推荐理由:技术文按监督微调、GRPO与分阶段课程写清Granite 4.2的训练路径,并写明只有8B和30B做真实环境里的智能体训练。
Liquid AI 发布三款 LFM2.5 的 DSpark 草稿模型,在不改变贪心输出的前提下,把 GPU 吞吐最高做到 3.18 倍、端侧最高做到 2.87 倍。
Google DeepMind 的 WeatherNext 在 Nature 论文中显示,气旋路径、强度和风场的三天预报平均达到以往模型两天的水平。该模型用近 20TB 全球大气数据与 IBTrACS 中近 5000 场历史风暴联合训练,今年把集合规模扩至 1000 个成员,可在 TPU 上不到一分钟生成 15 天预报。
推荐理由:三天气旋预报达到以往模型两天的水平,并开源 WeatherNext 2 与气旋模型,预报流程因此多出约一天可准备的时间。
Mistral 以 Apache 2.0 发布 3B 开源权重多模态安全分类器 Shieldstral,把内容审核做成推理时可用自然语言政策作答的二分类问答。请求包含评估说明、是否类问题和待审内容,模型只读取 yes 与 no 的 logits,经 softmax 得到连续安全分数,同一接口覆盖提示、回复、提示与回复组合以及图像。
Mistral发布Apache-2.0免费模型Leanstral 1.5,总参数119B、激活参数6B,在miniF2F验证集与测试集均达到100%,并解出PutnamBench 672题中的587题。
推荐理由:原文给出6B激活参数模型的基准成绩、约4美元单题成本和开源入口,读者可以据此比较它与更高成本形式验证系统的差异。
Google DeepMind发布实验性开源模型DiffusionGemma,这款26B MoE以文本扩散整块并行生成文本,在专用GPU上最高可实现4倍加速。
推荐理由:DiffusionGemma把本地文本生成从逐token解码改成整段并行起草,并交代相对Gemma 4的速度、显存和质量取舍,便于判断它适合哪些交互式本地工作流。