IBM Granite 4.2推理模型如何构建
Granite 4.2从Granite-4.1基座出发,经监督微调和多阶段GRPO强化学习,得到3B、8B、30B三款稠密仅解码器推理模型。监督微调约用7.2 million条样本(约100B token,其中约65B可训练);基座则以约15T token分五阶段从零预训练,并把上下文扩到512K。
推荐理由:技术文按监督微调、GRPO与分阶段课程写清Granite 4.2的训练路径,并写明只有8B和30B做真实环境里的智能体训练。
Granite 4.2从Granite-4.1基座出发,经监督微调和多阶段GRPO强化学习,得到3B、8B、30B三款稠密仅解码器推理模型。监督微调约用7.2 million条样本(约100B token,其中约65B可训练);基座则以约15T token分五阶段从零预训练,并把上下文扩到512K。
推荐理由:技术文按监督微调、GRPO与分阶段课程写清Granite 4.2的训练路径,并写明只有8B和30B做真实环境里的智能体训练。
Gradio 的 gr.Workflow 用类型节点图把 AI 流水线变成可拖拽界面,同一张图同时是 REST API,并可一键部署到 Hugging Face Spaces。
推荐理由:把多步 AI 流程写成带类型端口的节点图后,可以在画布上单独运行每一步并看到中间值,同一张图还能作为 REST 接口部署到 Spaces。
Mistral 与 HUMAIN 宣布战略合作,在沙特及中东推进主权 AI。合作覆盖 AI 基础设施、先进模型开发与解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心,双方还计划面向沙特受监管行业制定联合市场策略。
Hugging Face 提出三项测试,评估 11 个开源语音识别模型是否针对公开基准优化,而非提升通用转写。
推荐理由:三项测试显示,部分模型在公开语音基准上的高分,与其识别数据集线索并复现参考文本有关,单一词错误率因此不足以代表通用转写能力。
Hugging Face 说明如何用 Jobs、Storage Buckets 和 Inference Endpoints 支撑 Papers with Code 的混合搜索:离线批量生成论文向量,在线只嵌入查询,端点冷启动或异常时回退全文检索。
Liquid AI 发布三款 LFM2.5 的 DSpark 草稿模型,在不改变贪心输出的前提下,把 GPU 吞吐最高做到 3.18 倍、端侧最高做到 2.87 倍。
Mistral推出Agentic Search,让模型通过search、open、navigate、read和grep五个工具,在现有索引上多步查找、打开并核对长文档与多来源信息。
推荐理由:Mistral把一次取块改成可导航核对的多步检索,使FinanceBench正确率从26.7%升至86%并降低延迟与token。
ALTK-Evolve在AppWorld test_normal上对照八个模型发现,自蒸馏记忆的合适剂量取决于模型能力。强模型DeepSeek-V3.2注入全量指南后TGC提升9.5个百分点,弱模型gpt-oss-120b用精选检索提升16.1个百分点且token仅增5%,饱和模型GLM-5增益为0。这些指南从智能体过往轨迹蒸馏,推理时注入,不更新模型权重,也不需要人工标注。
Sentence Transformers v6.0 新增 MultiVectorEncoder,以 ColBERT 式晚交互为每个 token 保留向量,并用 MaxSim 为查询与文档打分。
推荐理由:这篇官方教程把多向量晚交互和单向量嵌入的质量与索引成本放在一起比较,并写清编码、打分、检索重排和压缩索引的具体做法。
Hugging Face 基于 2026 年 1 月至 8 月的 Hub 活动写道,开源模型的点赞热度与下载采用几乎不重合,Qwen 已成为社区衍生数量领先的基础模型之一。
推荐理由:报告用下载量、点赞和衍生仓库对照社区关注与实际采用,说明覆盖多种尺寸的模型家族比只推超大前沿模型更容易进入开发者的日常工作流。
Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体,距 3.6 Flash 仅三周,入门价为原先每百万 token 成本的一半。
推荐理由:Gemini 3.7 Flash 在 3.6 Flash 发布仅三周后推出,编码调试、网页生成和复杂文档处理基准均有提升,同时入门价定为原先每百万 token 成本的一半。
Hugging Face 组织社区在 19 天内尝试复现 2226 篇 ICML 2026 论文,被核查论文中 51%(1103 篇)至少有一条主张得到独立验证,23%(496 篇)至少有一条被证伪或存在争议。
推荐理由:这场挑战把论文拆成可核验主张并鼓励多团队独立复现,既能抓住审稿未细查的数学错误,也会暴露复现脚本自己的计算漏洞。
MindTopo 基准显示,多模态模型识别静态拓扑关系的表现明显强于交互规划,且两者都远低于人类。它按连续性、分离、顺序、包围和结五类,分别测试推理与规划;规划错误常出现在理解场景之后,模型会丢失结构关系或提出违反环境动态的动作。图像生成只在关系可见于单帧时偶尔有帮助,视频推演则经常改变拓扑或违反任务动态。
Google DeepMind发布大规模多语言手语转文本模型SL2T,先在Pixel 11的Gboard和Live Transcribe中把美国手语译成英语听写。
推荐理由:SL2T把超过五十种手语的身体关键点直接译成流式文本,并开始用于Pixel 11听写,读者可以据此了解手语输入如何接进日常打字。
Google Research 提出知识画像,发现前沿大语言模型的许多事实错误是召回失败,而不是事实未被编码。基于 2,150 条维基事实的 WikiProfile 显示,Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,但仍有 26–34% 无法直接召回,开启思考后失败比例为 11–12%。
推荐理由:用知识画像同时衡量事实的编码和召回后,前沿模型的事实性短板更集中于已经写入参数却难以稳定取出的知识。
Google Research 展示基于 Gemini 与 Project Astra 的 AMIE(Video),在100个情景、300次模拟实时视频问诊中,被20名全科医生评为在病史采集、诊断准确性、处置适当性和沟通质量上与10名视频问诊全科医生相当。
推荐理由:随机研究把AMIE视频版、纯文本版和全科医生放在同一评分框架下,从而呈现视听观察和虚拟查体的评分差异以及演员模拟边界。
Mistral 推进三项 AI 主权举措:区域内推理、开放模型与欧洲长期算力。Regional Endpoints 已全面可用,可选欧洲或美国;Priority Tier 公开预览,提供 uptime SLA。平台将先接入 Z.ai 的 GLM-5.2,并以 European Compute Units 承接多年承诺。
NVIDIA Magpie Multilingual TTS 以 364M 参数开放权重覆盖 12 种语言,可在自有基础设施内部署,用来构建可自行掌控延迟的多语言语音智能体。
Meta 今日发布从 Muse 蒸馏而来的多模态模型 Muse Glimmer,参数规模 30B,采用 Apache 2.0 许可,面向可本地部署的编程、文档分析和个人助理。
推荐理由:分类基准将 Muse Glimmer-30B 与 Gemma4-31B、Qwen3.6-27B 对照,便于按智能体、编程和多模态场景比较。
Google DeepMind 的 WeatherNext 在 Nature 论文中显示,气旋路径、强度和风场的三天预报平均达到以往模型两天的水平。该模型用近 20TB 全球大气数据与 IBTrACS 中近 5000 场历史风暴联合训练,今年把集合规模扩至 1000 个成员,可在 TPU 上不到一分钟生成 15 天预报。
推荐理由:三天气旋预报达到以往模型两天的水平,并开源 WeatherNext 2 与气旋模型,预报流程因此多出约一天可准备的时间。
Baseten 已接入 Hugging Face Hub 的 Inference Providers,开发者可在模型页以及 Python 与 JavaScript SDK 中调用其无服务器推理。
Mistral 以 Apache 2.0 发布 3B 开源权重多模态安全分类器 Shieldstral,把内容审核做成推理时可用自然语言政策作答的二分类问答。请求包含评估说明、是否类问题和待审内容,模型只读取 yes 与 no 的 logits,经 softmax 得到连续安全分数,同一接口覆盖提示、回复、提示与回复组合以及图像。
微软研究院发布开源框架 Orchard,用 Kubernetes 环境服务 Orchard Env 在 Codex、OpenClaw、ZeroClaw 等真实框架中训练软件工程、网页与助手智能体。
推荐理由:微软研究院的 Orchard 用可复用环境让智能体在真实部署框架中训练,约 3B 激活参数的开放模型因而在 SWE-bench Verified 上达到 69.7% 并在价值模型重排后升至 73.0%。
Google Research 提出 Chain-of-Evidence(CoE)及原型 Science One Framework,在研究主张生成时建立并维护证据链。
微软研究院构建 Echoverse,用十个深度领域世界和两个能力世界训练计算机使用智能体。在全部十二个世界上训练后,Qwen3.5-9B 的平均分从 36.5% 升至 67.1%,距 GPT-5.4 的 80.7% 约十四个百分点。
Google DeepMind 今天发布 Gemini Robotics ER 2,将其作为机器人的高层具身推理模型,用于对话、理解物理世界和多步规划,再把运动执行交给下层视觉语言动作模型。
推荐理由:新模型相对 ER 1.6 补上了连续视频中的进度判断与多机协作能力,开发者可把它接到下层动作模型来编排多步实体任务。
Google DeepMind 今日在 Google Flow Music 推出 Lyria 3.5,提升音乐性、歌词、人声质量与创作控制。作为最新音乐生成模型,它能帮助用户做出更丰富的曲目。
Google DeepMind 推出 Gemini Robotics 2,把视觉和语言输入转成电机控制,让完整人形机器人和双臂机器人完成从脚到指尖的全身动作与灵巧操作。
推荐理由:这次更新把原先的桌面上半身操作扩展到全身协调、灵巧操作和多机协作,并说明端侧模型可用数小时数据适配新机体。
Google Research让13917人随机使用五种Gemini Flash 2.0 SymptomAI智能体做症状问诊和鉴别诊断。三名委员会认证临床医生盲评后,在超过50%的案例中更偏好SymptomAI的鉴别诊断,也更常判定其top-5结果包含参与者两周后报告的就医诊断;各主动追问策略均显著优于不追问的基础模型。
推荐理由:13917人的随机研究显示,临床专家在超过50%的案例里更偏好SymptomAI的鉴别诊断,主动追问也优于不追问的基础对话。
Google DeepMind 在 DOE Genesis Mission Summit 2026 宣布,承诺提供价值 $40 million 的 AI token 与云额度,支持 Genesis Mission 的研究人员。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber,用于以更高 token 效率、更低延迟和更可靠表现规模化构建 AI 智能体。
推荐理由:官方把三款新模型相对前代的token用量、速度、价格和基准分数放在一起,便于比较它们在智能体工作流里的成本与能力取舍。
Google 推出 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证并修补漏洞,并在这些任务上比主线 Flash 模型更有效。
Hugging Face 本周侦测并处置了生产基础设施中由自主 AI 智能体端到端发动的入侵,对方未经授权接触了有限内部数据集和若干服务凭证;尚未发现面向用户的公开模型、数据集或 Spaces 被篡改,容器镜像与已发布软件包经验证干净,合作方或客户数据是否受影响仍在评估。
推荐理由:这次事件给出的可迁移做法是事先在自有基础设施备好可用模型,以免托管服务护栏阻断取证或导致攻击数据与凭证外流。
IBM Research 在智能体里做模型路由时发现,选模型会从分类问题变成同时权衡成本、质量、延迟、合规与可靠性的系统优化。
Thinking Machines 发布开源模型 Inkling,原生支持图像、文本和音频,总参数 975B、激活 41B,上下文 1M。
推荐理由:Inkling给出975B总参数的原生图文音频架构、Small变体和多档显存部署配置,读者可据此比较开源超大模型的接入成本。
Hume 发布 Real World VoiceEQ,用超过 100 万次人工评分,在 15 个以上维度和 60 多项指标上评估 40 多个专有与开源语音模型。评测覆盖自动语音识别、文字转语音、语音到语音和语音理解,目前包含 785,000 条 TTS 评分与 48,000 条 STS 评分。文字转语音中没有任何系统配置在八个能力组全部进入前五,噪声背景下的转写字错率约为音乐背景的四倍。
Hugging Face 的 PyTorch Profiling 系列第三篇,在 NVIDIA A100-SXM4-80GB 上用 profiler 对照了手写因果注意力和 SDPA 的 math、efficient、flash、cudnn 后端。
推荐理由:把朴素注意力和 SDPA 四个后端放进同一套 profiler 轨迹后,可以看出融合如何避免中间分数矩阵写入显存,以及 flash 很低的占用率为何仍可能更快。
Google Research 提出大型传感器基础模型 SensorFM,用五百万名同意参与者超过一万亿分钟的无标签多模态可穿戴信号学习可复用生理表征。
Mistral 发布 8B 模型 Robostral Navigate,仅凭单目 RGB 相机和自然语言指令让机器人自主导航,在 R2R-CE 验证集未见环境达到 76.6% 成功率。
transformers的vLLM建模后端现已在许多LLM架构上达到或超过手写vLLM实现的速度,模型作者可直接复用transformers代码获得高速推理。对比覆盖Qwen3-4B单GPU、Qwen3-32B的双GPU张量并行,以及Qwen3-235B-A22B-FP8在同一8×H100节点上的数据并行加专家并行,该后端吞吐均达到或超过原生实现。