Google Research 如何通过协调少量导航行程减少城市拥堵
Google Research 在 10 座美国主要城市修改 Google Maps,把遇到预设拥堵路段的行程导向行驶时间和路段类型相近的替代路线,不足 2% 的观测行程被改写后,目标路段行驶速度中位数提升约 2%。
Google Research 在 10 座美国主要城市修改 Google Maps,把遇到预设拥堵路段的行程导向行驶时间和路段类型相近的替代路线,不足 2% 的观测行程被改写后,目标路段行驶速度中位数提升约 2%。
Microsoft 在 Build 2026 宣布推出 Foundry Managed Compute,并将每周刷新的 Hugging Face 精选开源权重以一键方式部署到该托管算力。
Hugging Face 与 SkyPilot 联合把 Hugging Face Storage 做成 SkyPilot 的 store: hf 后端。
LeRobot v0.6.0 发布,用世界模型策略、奖励模型 API、部署 CLI 和六项仿真基准补齐机器人学习闭环。
推荐理由:LeRobot 这次把会想象未来的策略、成功奖励和失败修正采集收进同一条开源机器人学习闭环,方便对照现有的训练评测与部署流程。
Google DeepMind与A24今天宣布以研究为重点的同类首个合作,帮助艺术家开发新工作流和技术,Google并对A24作出投资。双方将开展跨越多个项目的深度研发,把创新放进创作过程,由A24电影人帮助塑造技术并拓展叙事可能,同时向DeepMind提供艺术家反馈。合作初期聚焦连接前沿技术与下一代娱乐,具体目标、技术产出和创作里程碑将随时间演变。
Mistral发布Apache-2.0免费模型Leanstral 1.5,总参数119B、激活参数6B,在miniF2F验证集与测试集均达到100%,并解出PutnamBench 672题中的587题。
推荐理由:原文给出6B激活参数模型的基准成绩、约4美元单题成本和开源入口,读者可以据此比较它与更高成本形式验证系统的差异。
IBM Research推出开源基准ScarfBench,评测AI智能体能否把企业Java应用在Spring、Jakarta EE与Quarkus之间迁移,并真正完成构建、部署和行为保持。
Google DeepMind 开放 Nano Banana 2 Lite 与 Gemini Omni Flash,分别用于高速图像生成,以及视频生成和对话式编辑。
推荐理由:官方同时给出图像模型的延迟与单价,以及视频模型的按秒定价和时长限制,读者可以据此估算图生视频迭代的成本。
Google Research 推出零样本表格基础模型 TabFM,一次前向即可对未见过的表做分类和回归,无需逐表训练、调参和特征工程。它把整张表当作统一提示,用行列交替注意力、行压缩和 Transformer 做上下文学习,全部基于数亿个结构因果模型合成的数据集预训练。
推荐理由:把表格预测改写成上下文学习之后,读者可以对照传统树模型流程判断单次前向能否省掉调参和特征工程。
Google Research发现,开启推理能让模型召回简单单跳问题上关闭推理时几乎无法得到的事实,机制是计算缓冲和factual priming。对Gemini-2.5 Flash、Pro与Qwen3-32B,等长重复Let me think已明显好于关闭推理,但始终不能完全赶上自然轨迹;相关事实即使在推理关闭时也能挽回大部分增益。
计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可构建在浏览器、移动端和桌面中观察、推理并执行操作的自定义智能体。
推荐理由:原先独立的Gemini 2.5计算机使用模型已并入Gemini 3.5 Flash,开发者可据此构建跨端长程自动化智能体,并选用操作确认与注入拦截。
Mistral 发布 Mistral OCR 4,在提取文本之外返回边界框、类型化块分类和行内置信度,支持 10 个语系共 170 种语言,并可在单个容器中完全自托管。
推荐理由:官方说明 Mistral OCR 4 在文本之外返回边界框、块分类和置信度,并公布人工评测胜率与基准分数,便于评估其进入检索和自托管流水线的条件。
Google Research 在 JAMA Dermatology 本周发表的调查显示,2345 名参与者借助原型 AI 猜出皮肤状况名称的准确率为 23%,高于普通搜索的 8%,而由皮肤科医生给出真实鉴别诊断的 Wizard of Oz 界面达到 36%。
Google DeepMind发布实验性开源模型DiffusionGemma,这款26B MoE以文本扩散整块并行生成文本,在专用GPU上最高可实现4倍加速。
推荐理由:DiffusionGemma把本地文本生成从逐token解码改成整段并行起草,并交代相对Gemma 4的速度、显存和质量取舍,便于判断它适合哪些交互式本地工作流。
Google 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70 多种语言,并近实时生成保留语调、节奏和音高的语音翻译。
推荐理由:相比轮次等待后再译,Gemini 3.5 Live Translate 会持续出声并落后说话人仅几秒,读者可据此了解它进入翻译应用、Meet 和开发接口后的实时互译方式。
Google DeepMind 发布面向笔记本的 Gemma 4 12B,采用无编码器统一架构,让视觉和音频直接进入 LLM 主干。它是该系列首个支持原生音频输入的中等尺寸模型,标准基准表现接近 26B MoE,总内存不到后者一半,16GB VRAM 或统一内存即可本地运行,以 Apache 2.0 许可发布并配备 MTP drafter。
推荐理由:它位于端侧友好的E4B与更先进的26B MoE之间,用无编码器设计把视觉和音频直接交给语言模型,并以不到一半内存接近更大模型的基准表现。
Google DeepMind的塞拉利昂预注册试验显示,Guided Learning组数学成绩比对照组高0.258个标准差,八周约合1.2到1.7年进度。逾113,000次互动中,91.4%的对话用于建立概念理解,Gemini在76%的消息里提出脚手架问题,只在2%的情形直接给解答;技能建构类提问由首周68%升至末周90%,寻求直接解答的提问由25%降至10%。
推荐理由:塞拉利昂八周试验显示,引导式学习带来0.258个标准差的数学增益,约一半课时使用Gemini的班级约合1.8到2.5年进度。
Google Research 在 Nature 发表研究系统 PHRM,可在日常人脸解锁后用前置摄像头拍摄数秒面部视频,并在后台估计心率与每日静息心率。
推荐理由:读者可以据此比较手机前置摄像头被动测心率与穿戴设备静息心率的误差,并了解研究如何按肤色分组控制精度差距。
Mistral 上线统一智能体 Vibe,把 Le Chat 收成覆盖办公与编码的同一产品和许可,原有对话、设置与套餐已迁移。Work Mode 可在网页和移动端跨企业工具处理收件、研究与文档等长任务,Code Mode 则在隔离沙箱中把编码做到可审查的 pull request,并提供 VS Code 扩展与 CLI。
推荐理由:Vibe 将办公长任务与编码会话收进同一智能体,并公开网页、VS Code 和 CLI 入口,读者可以对照它如何承接从计划确认到可审查改动的流程。
Mistral AI 今日以公开预览发布开源 Search Toolkit,把数据接入、检索和评测统一为面向 AI 应用的生产级搜索管线。检索支持 BM25 稀疏检索、稠密嵌入检索和混合配置,评测内置召回率、精确率、MRR 与 NDCG,可在自有测试集上对比配置。框架可在云端、本地或边缘运行;CMA CGM 将其与 Voxtral 配合处理三个音频来源,并在 15 秒内端到端返回预警。
推荐理由:它把文档接入、混合检索和内置评测收进同一开源框架,便于团队在自有数据上单独比较检索配置并衡量质量。
Mistral 发布 128B 稠密开源权重模型 Mistral Medium 3.5,并将其作为 Mistral Vibe 与 Le Chat 的默认模型,同时上线可在云端并行异步运行的远程编程智能体。
推荐理由:新的128B开源权重模型把编程会话放到云端并行运行,开发者可在离开后查看进度并在敏感操作前做人工确认。
Mistral 今日在 Studio 以 Public Preview 发布 Connectors,内置连接器与自定义 MCP 现可通过 API/SDK 用于全部模型和智能体调用。
Google DeepMind 正在亚太启动首期 Accelerator 项目,以 “AI for the Planet” 应对环境风险。这一为期三个月的项目面向区域内的初创公司、研究团队和非营利组织。
Google 今日在 Nature 发表科学代码工具 ERA,并开始逐步开放由 ERA 与 AlphaEvolve 构建的 Computational Discovery。
推荐理由:原文说明ERA如何用树搜索迭代科学代码,并给出可对照CDC榜单的住院预测,读者可以据此判断它缩短的是哪一段实验周期。
Google DeepMind为Project Genie上线Street View实景锚定,创建世界时可选美国地点和风格,使起点绑定真实街景影像。用户可借助Maps Imagery Grounding,例如用Ocean World风格在金门大桥周围潜水,或用B&W film风格查看1920年代的Fort Worth Stockyards。
Google DeepMind 推出 Gemini Omni 家族的首个模型 Gemini Omni Flash,可将图像、音频、视频和文本作为输入生成视频,并用自然语言多轮编辑且保持角色、物理和场景连贯。
推荐理由:官方同时给出对话式编辑、物理与世界知识约束以及SynthID核验路径,读者可以据此判断这款视频模型会怎样进入现有创作流程。
Google 扩展 Search、Gemini、Chrome、Pixel 与 Cloud 的内容透明度与核验工具,帮助用户了解网上内容如何被创建和编辑。
推荐理由:Google 把 SynthID 与内容凭证核验扩到搜索、浏览器和手机,并在云端提供检测接口,方便分辨模型生成内容与相机拍摄原片。
MIT的Ritu Raman与波士顿儿童医院的Ryan Flynn借助Co-Scientist打通实验室,联合工具箱探索ALS。机械工程师Raman搭建活体神经和肌肉组织,模拟影响随意运动的疾病;其丈夫Flynn是化学生物学家,绘制细胞表面RNA,研究它如何影响细胞通讯和病原体入侵。
斯坦福大学医学院的Gary Peltz让Co-Scientist从既有药物中提出三款肝纤维化候选,其中两款在活体人肝细胞测试中阻断纤维化并促进肝细胞再生,而他依据文献自选的两款没有益处。
Google DeepMind 与 Google Research 的 AI 天气模型 WeatherNext,在五天前以 80% 置信度预测飓风梅利莎将以五级强度登陆牙买加,帮助国家飓风中心提前预警。
Google DeepMind 发布 Gemini 3.5 模型家族,并开放 Gemini 3.5 Flash,使其成为全球 Gemini 应用和 Google 搜索 AI Mode 的默认模型,同时进入 Google Antigravity、Gemini API 及企业平台。
推荐理由:3.5 Flash已同时向用户、开发者和企业开放,智能体与编码基准超过Gemini 3.1 Pro,可比较其速度和落地范围。
Google DeepMind 在 Nature 发表 Co-Scientist,用 Gemini 多智能体迭代生成、辩论并演化科学假设。在肝纤维化合作中,系统标出的一种药物重定位候选在实验室测试里阻断了 91% 与瘢痕相关的反应。个人研究者可在 labs.google/science 登记兴趣,Hypothesis Generation 实验工具将于未来数周开始推出。
推荐理由:文中把多智能体假设生成拆成提出、辩论与演化三阶段,并说明它如何在肝纤维化等课题里帮助研究者收敛可检验方向。
AlphaEvolve 团队分享了这一 Gemini 驱动编码智能体至今最显著的跨领域影响,应用已从数学和计算机科学扩展到健康、可持续、量子计算、AI 基础设施与商业优化。
推荐理由:把测序纠错、电网求解、量子电路和企业路由等结果放在一起,可以看出这个编码智能体已从算法发现延伸到基础设施与商业优化。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者的 triadic care。在盲测中,医生更偏好 AI co-clinician 而非领先的证据综合工具;98 项基层医疗问询里有 97 例没有关键错误,开放式 OpenFDA RxQA 用药问答也优于其他前沿模型。
Google Research 科学家与学术合作者已用 Empirical Research Assistance(ERA)开展四类研究,涵盖美国流感、COVID-19 和 RSV 住院预报、宇宙弦引力辐射、GOES East 二氧化碳估计以及斑马鱼神经回路。
Mistral今日以公开预览发布Workflows,作为Studio中的企业AI编排层,用于把AI流程从概念验证可靠推进到生产。开发者用Python编写流程并发布到Le Chat触发,可用wait_for_input()暂停等待人工审批且不消耗算力。
Google Photos 的 Auto frame 现已加入拍后重设视角能力,用机器学习理解场景与空间布局,再用生成式 AI 从新机位生成照片。方法先估计三维点图、可见表面和原相机焦距,重点减少人体与面部重建伪影,再渲染调整后的相机位姿和焦距;新露出的区域由潜空间扩散模型补全,并以分类器引导和区域缩放保留原内容。
推荐理由:Google Photos 的 Auto frame 会把已拍照片当作三维场景并自动调整机位,同时补全新视角里原先不可见的内容从而改善人像与广角构图。
GRASP 是面向学习得到的动力学(世界模型)的新型梯度规划器,靠三项设计让长时域规划变得可行。它将轨迹提升到虚拟状态,使优化可沿时间并行;把随机性直接加进状态迭代用于探索;并重塑梯度,让动作获得干净信号,同时避开高维视觉模型中脆弱的 state-input 梯度。
Google DeepMind发布Gemini 3.1 Flash TTS,用可嵌入文本的音频标签控制风格、语速与表达。该模型即日起向开发者通过Gemini API和Google AI Studio预览,企业通过Vertex AI预览,Workspace用户可通过Google Vids使用。
推荐理由:开发者可以把自然语言音频标签直接写进文本,在句中切换语气和语速,再将同样的参数导出为Gemini API代码,以便在不同项目中保持一致音色。
Google DeepMind 发布 Gemini Robotics-ER 1.6,将其作为机器人的高层推理模型,强化空间与物理推理、多视角理解及任务成功检测,并新增仪表读数。
推荐理由:新版相对 Gemini Robotics-ER 1.5 与 Gemini 3.0 Flash 强化了空间指向、物体计数、多视角成功检测以及仪表读数能力,开发者现可在 Gemini API 与 Google AI Studio 中直接配置调用。