IBM Research 复盘为何智能体模型路由并不简单
IBM Research 在智能体里做模型路由时发现,选模型会从分类问题变成同时权衡成本、质量、延迟、合规与可靠性的系统优化。
IBM Research 在智能体里做模型路由时发现,选模型会从分类问题变成同时权衡成本、质量、延迟、合规与可靠性的系统优化。
Thinking Machines 发布开源模型 Inkling,原生支持图像、文本和音频,总参数 975B、激活 41B,上下文 1M。
推荐理由:Inkling给出975B总参数的原生图文音频架构、Small变体和多档显存部署配置,读者可据此比较开源超大模型的接入成本。
Hume 发布 Real World VoiceEQ,用超过 100 万次人工评分,在 15 个以上维度和 60 多项指标上评估 40 多个专有与开源语音模型。评测覆盖自动语音识别、文字转语音、语音到语音和语音理解,目前包含 785,000 条 TTS 评分与 48,000 条 STS 评分。文字转语音中没有任何系统配置在八个能力组全部进入前五,噪声背景下的转写字错率约为音乐背景的四倍。
Hugging Face 的 PyTorch Profiling 系列第三篇,在 NVIDIA A100-SXM4-80GB 上用 profiler 对照了手写因果注意力和 SDPA 的 math、efficient、flash、cudnn 后端。
推荐理由:把朴素注意力和 SDPA 四个后端放进同一套 profiler 轨迹后,可以看出融合如何避免中间分数矩阵写入显存,以及 flash 很低的占用率为何仍可能更快。
Google Research 提出大型传感器基础模型 SensorFM,用五百万名同意参与者超过一万亿分钟的无标签多模态可穿戴信号学习可复用生理表征。
Mistral 发布 8B 模型 Robostral Navigate,仅凭单目 RGB 相机和自然语言指令让机器人自主导航,在 R2R-CE 验证集未见环境达到 76.6% 成功率。
transformers的vLLM建模后端现已在许多LLM架构上达到或超过手写vLLM实现的速度,模型作者可直接复用transformers代码获得高速推理。对比覆盖Qwen3-4B单GPU、Qwen3-32B的双GPU张量并行,以及Qwen3-235B-A22B-FP8在同一8×H100节点上的数据并行加专家并行,该后端吞吐均达到或超过原生实现。
Google Research 在 10 座美国主要城市修改 Google Maps,把遇到预设拥堵路段的行程导向行驶时间和路段类型相近的替代路线,不足 2% 的观测行程被改写后,目标路段行驶速度中位数提升约 2%。
Microsoft 在 Build 2026 宣布推出 Foundry Managed Compute,并将每周刷新的 Hugging Face 精选开源权重以一键方式部署到该托管算力。
Hugging Face 与 SkyPilot 联合把 Hugging Face Storage 做成 SkyPilot 的 store: hf 后端。
LeRobot v0.6.0 发布,用世界模型策略、奖励模型 API、部署 CLI 和六项仿真基准补齐机器人学习闭环。
推荐理由:LeRobot 这次把会想象未来的策略、成功奖励和失败修正采集收进同一条开源机器人学习闭环,方便对照现有的训练评测与部署流程。
Fable在KernelBench-Mega上用CUDA写出megakernel,于RTX PRO 6000 Blackwell相对优化后的PyTorch基线达到18.71X加速,高于写Triton的Claude Opus 4.8(14.4X)、GLM-5.2(11.14X)和GPT 5.5(4.34X),且每个解码token只启动一次协作式kernel。
Google DeepMind与A24今天宣布以研究为重点的同类首个合作,帮助艺术家开发新工作流和技术,Google并对A24作出投资。双方将开展跨越多个项目的深度研发,把创新放进创作过程,由A24电影人帮助塑造技术并拓展叙事可能,同时向DeepMind提供艺术家反馈。合作初期聚焦连接前沿技术与下一代娱乐,具体目标、技术产出和创作里程碑将随时间演变。
Mistral发布Apache-2.0免费模型Leanstral 1.5,总参数119B、激活参数6B,在miniF2F验证集与测试集均达到100%,并解出PutnamBench 672题中的587题。
推荐理由:原文给出6B激活参数模型的基准成绩、约4美元单题成本和开源入口,读者可以据此比较它与更高成本形式验证系统的差异。
IBM Research推出开源基准ScarfBench,评测AI智能体能否把企业Java应用在Spring、Jakarta EE与Quarkus之间迁移,并真正完成构建、部署和行为保持。
Google DeepMind 开放 Nano Banana 2 Lite 与 Gemini Omni Flash,分别用于高速图像生成,以及视频生成和对话式编辑。
推荐理由:官方同时给出图像模型的延迟与单价,以及视频模型的按秒定价和时长限制,读者可以据此估算图生视频迭代的成本。
Google Research 推出零样本表格基础模型 TabFM,一次前向即可对未见过的表做分类和回归,无需逐表训练、调参和特征工程。它把整张表当作统一提示,用行列交替注意力、行压缩和 Transformer 做上下文学习,全部基于数亿个结构因果模型合成的数据集预训练。
推荐理由:把表格预测改写成上下文学习之后,读者可以对照传统树模型流程判断单次前向能否省掉调参和特征工程。
Google Research在CIDR提出线性弹性缓存,以滑雪租赁式页面淘汰和轻量机器学习降低缓存总拥有成本。部分无服务器云厂商对1 GiB内存的收费最高可达每天3美元。
Google Research发现,开启推理能让模型召回简单单跳问题上关闭推理时几乎无法得到的事实,机制是计算缓冲和factual priming。对Gemini-2.5 Flash、Pro与Qwen3-32B,等长重复Let me think已明显好于关闭推理,但始终不能完全赶上自然轨迹;相关事实即使在推理关闭时也能挽回大部分增益。
计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可构建在浏览器、移动端和桌面中观察、推理并执行操作的自定义智能体。
推荐理由:原先独立的Gemini 2.5计算机使用模型已并入Gemini 3.5 Flash,开发者可据此构建跨端长程自动化智能体,并选用操作确认与注入拦截。
Mistral 发布 Mistral OCR 4,在提取文本之外返回边界框、类型化块分类和行内置信度,支持 10 个语系共 170 种语言,并可在单个容器中完全自托管。
推荐理由:官方说明 Mistral OCR 4 在文本之外返回边界框、块分类和置信度,并公布人工评测胜率与基准分数,便于评估其进入检索和自托管流水线的条件。
四项实验显示人工智能的文本说服力超过专家人类,自维持系统取决于人形机器人,DeepMind论文则讨论从AGI走向ASI的路径。
Google Research 在 JAMA Dermatology 本周发表的调查显示,2345 名参与者借助原型 AI 猜出皮肤状况名称的准确率为 23%,高于普通搜索的 8%,而由皮肤科医生给出真实鉴别诊断的 Wizard of Oz 界面达到 36%。
Google DeepMind发布实验性开源模型DiffusionGemma,这款26B MoE以文本扩散整块并行生成文本,在专用GPU上最高可实现4倍加速。
推荐理由:DiffusionGemma把本地文本生成从逐token解码改成整段并行起草,并交代相对Gemma 4的速度、显存和质量取舍,便于判断它适合哪些交互式本地工作流。
Google 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70 多种语言,并近实时生成保留语调、节奏和音高的语音翻译。
推荐理由:相比轮次等待后再译,Gemini 3.5 Live Translate 会持续出声并落后说话人仅几秒,读者可据此了解它进入翻译应用、Meet 和开发接口后的实时互译方式。
Google DeepMind 发布面向笔记本的 Gemma 4 12B,采用无编码器统一架构,让视觉和音频直接进入 LLM 主干。它是该系列首个支持原生音频输入的中等尺寸模型,标准基准表现接近 26B MoE,总内存不到后者一半,16GB VRAM 或统一内存即可本地运行,以 Apache 2.0 许可发布并配备 MTP drafter。
推荐理由:它位于端侧友好的E4B与更先进的26B MoE之间,用无编码器设计把视觉和音频直接交给语言模型,并以不到一半内存接近更大模型的基准表现。
Google DeepMind的塞拉利昂预注册试验显示,Guided Learning组数学成绩比对照组高0.258个标准差,八周约合1.2到1.7年进度。逾113,000次互动中,91.4%的对话用于建立概念理解,Gemini在76%的消息里提出脚手架问题,只在2%的情形直接给解答;技能建构类提问由首周68%升至末周90%,寻求直接解答的提问由25%降至10%。
推荐理由:塞拉利昂八周试验显示,引导式学习带来0.258个标准差的数学增益,约一半课时使用Gemini的班级约合1.8到2.5年进度。
Google Research 在 Nature 发表研究系统 PHRM,可在日常人脸解锁后用前置摄像头拍摄数秒面部视频,并在后台估计心率与每日静息心率。
推荐理由:读者可以据此比较手机前置摄像头被动测心率与穿戴设备静息心率的误差,并了解研究如何按肤色分组控制精度差距。
Google Research 在 GitHub 以 Apache 2.0 开源水文建模框架,供各国气象水文机构接入 AI 洪水预报。该 Python 包基于 PyTorch 与 LSTM,结合 Caravan 历史河流数据及气候、土壤、地形、土地覆盖和气象预报,预测河流日流量。
Mistral 上线统一智能体 Vibe,把 Le Chat 收成覆盖办公与编码的同一产品和许可,原有对话、设置与套餐已迁移。Work Mode 可在网页和移动端跨企业工具处理收件、研究与文档等长任务,Code Mode 则在隔离沙箱中把编码做到可审查的 pull request,并提供 VS Code 扩展与 CLI。
推荐理由:Vibe 将办公长任务与编码会话收进同一智能体,并公开网页、VS Code 和 CLI 入口,读者可以对照它如何承接从计划确认到可审查改动的流程。
Mistral AI 今日以公开预览发布开源 Search Toolkit,把数据接入、检索和评测统一为面向 AI 应用的生产级搜索管线。检索支持 BM25 稀疏检索、稠密嵌入检索和混合配置,评测内置召回率、精确率、MRR 与 NDCG,可在自有测试集上对比配置。框架可在云端、本地或边缘运行;CMA CGM 将其与 Voxtral 配合处理三个音频来源,并在 15 秒内端到端返回预警。
推荐理由:它把文档接入、混合检索和内置评测收进同一开源框架,便于团队在自有数据上单独比较检索配置并衡量质量。
Jack Clark在牛津大学2026 Cosmos HAI Lab Lecture中提出,若AI按他的判断继续大幅进步,就不能当成普通技术,个人与社会应探索未来而不是从当下退缩。
Mistral 发布 128B 稠密开源权重模型 Mistral Medium 3.5,并将其作为 Mistral Vibe 与 Le Chat 的默认模型,同时上线可在云端并行异步运行的远程编程智能体。
推荐理由:新的128B开源权重模型把编程会话放到云端并行运行,开发者可在离开后查看进度并在敏感操作前做人工确认。
Mistral 今日在 Studio 以 Public Preview 发布 Connectors,内置连接器与自定义 MCP 现可通过 API/SDK 用于全部模型和智能体调用。
Google DeepMind 正在亚太启动首期 Accelerator 项目,以 “AI for the Planet” 应对环境风险。这一为期三个月的项目面向区域内的初创公司、研究团队和非营利组织。
Google 今日在 Nature 发表科学代码工具 ERA,并开始逐步开放由 ERA 与 AlphaEvolve 构建的 Computational Discovery。
推荐理由:原文说明ERA如何用树搜索迭代科学代码,并给出可对照CDC榜单的住院预测,读者可以据此判断它缩短的是哪一段实验周期。
生物学家 Omar Abudayyeh 与 Jonathan Gootenberg 正用 Co-Scientist 加快寻找能逆转细胞衰老的遗传线索。衰老研究的两大瓶颈是决定测试哪些遗传通路,以及理解实验产生的海量数据。
Google DeepMind为Project Genie上线Street View实景锚定,创建世界时可选美国地点和风格,使起点绑定真实街景影像。用户可借助Maps Imagery Grounding,例如用Ocean World风格在金门大桥周围潜水,或用B&W film风格查看1920年代的Fort Worth Stockyards。
Google DeepMind 推出 Gemini Omni 家族的首个模型 Gemini Omni Flash,可将图像、音频、视频和文本作为输入生成视频,并用自然语言多轮编辑且保持角色、物理和场景连贯。
推荐理由:官方同时给出对话式编辑、物理与世界知识约束以及SynthID核验路径,读者可以据此判断这款视频模型会怎样进入现有创作流程。
Google 扩展 Search、Gemini、Chrome、Pixel 与 Cloud 的内容透明度与核验工具,帮助用户了解网上内容如何被创建和编辑。
推荐理由:Google 把 SynthID 与内容凭证核验扩到搜索、浏览器和手机,并在云端提供检测接口,方便分辨模型生成内容与相机拍摄原片。