Google Research 介绍自动生成连贯长视频的 AI 协同导演框架
Google Research 介绍基于 Gemini 与 Veo 的 AI 视频协同导演,用多智能体编排规划多镜头长视频的视觉连续性。该套件包括将于 COLM 2026 发表的 Co-Director、将于 EMNLP 2026 发表的 CANVAS,以及 A²RD 与 VQQA,分别处理创意配置、持久视觉记忆、分段生成和提示词闭环修正,并继承 SynthID 水印。
Google Research 介绍基于 Gemini 与 Veo 的 AI 视频协同导演,用多智能体编排规划多镜头长视频的视觉连续性。该套件包括将于 COLM 2026 发表的 Co-Director、将于 EMNLP 2026 发表的 CANVAS,以及 A²RD 与 VQQA,分别处理创意配置、持久视觉记忆、分段生成和提示词闭环修正,并继承 SynthID 水印。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 公开超过 2800 种病毒蛋白复合物的预测三维结构,供各地科学家为未来疫情提前积累结构知识。
Google Research 推出 C++ 实例生成器 MilleMiglia,为中程配送问题生成真实、保护隐私的基准数据。中程物流被建模为时空图上的多商品流,不同于首末程的车辆路径问题。源代码与文档已在 GitHub 公开,用以弥补该领域缺少高质量公开数据的不足。
Google Research 分享一项研究实验,让教育者用面向学习优化的生成式用户界面,按课程与教学目标动态生成定制的互动教学模拟。示例库放出超过 30 个英语 STEM 学习互动,覆盖物理、化学、生物和数学,面向初中与高中,均由 AI 生成并经教师审核。
Google Research的Retrieve-for-Train将查询扇出蒸馏为53.9M扩散检索器,单次推理免去思考token。框架以集合级奖励对Gemma3-4B与Qwen3-4B做离线RL微调,并由冻结模型合成无需人工标注的监督数据。扩散检索器以一次非自回归前向,把查询嵌入直接映射为完整目标嵌入集合。
Google Research 联合 HHMI Janelia、MRC 分子生物学实验室和剑桥大学等合作者,在 Cell 发布雄性果蝇脑及中枢神经系统的完整连接组。
Google 的 MAPL-EMIT 用深度学习处理 EMIT 高光谱数据,自动检测并定位全球甲烷点源。专家标注羽流召回率达84%,信噪比高于匹配滤波增强方法,训练数据为3.6 million条合成羽流。全球羽流数据库已放上Earth Engine,训练模型与合成羽流在Kaggle,推理库在Github。
Google Research 在 Google Earth AI 中介绍实验性行星预测引擎 PPE,可根据自然语言查询自动完成地理空间数据发现、整理、训练、评估并生成报告,把含人工数据工程的建模时间从数周缩到数分钟。
Google Research 提出知识画像,发现前沿大语言模型的许多事实错误是召回失败,而不是事实未被编码。基于 2,150 条维基事实的 WikiProfile 显示,Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,但仍有 26–34% 无法直接召回,开启思考后失败比例为 11–12%。
推荐理由:用知识画像同时衡量事实的编码和召回后,前沿模型的事实性短板更集中于已经写入参数却难以稳定取出的知识。
Google Research 展示基于 Gemini 与 Project Astra 的 AMIE(Video),在100个情景、300次模拟实时视频问诊中,被20名全科医生评为在病史采集、诊断准确性、处置适当性和沟通质量上与10名视频问诊全科医生相当。
推荐理由:随机研究把AMIE视频版、纯文本版和全科医生放在同一评分框架下,从而呈现视听观察和虚拟查体的评分差异以及演员模拟边界。
Google Research 提出 Chain-of-Evidence(CoE)及原型 Science One Framework,在研究主张生成时建立并维护证据链。
Google Research让13917人随机使用五种Gemini Flash 2.0 SymptomAI智能体做症状问诊和鉴别诊断。三名委员会认证临床医生盲评后,在超过50%的案例中更偏好SymptomAI的鉴别诊断,也更常判定其top-5结果包含参与者两周后报告的就医诊断;各主动追问策略均显著优于不追问的基础模型。
推荐理由:13917人的随机研究显示,临床专家在超过50%的案例里更偏好SymptomAI的鉴别诊断,主动追问也优于不追问的基础对话。
Google Research 提出大型传感器基础模型 SensorFM,用五百万名同意参与者超过一万亿分钟的无标签多模态可穿戴信号学习可复用生理表征。
Google Research 在 10 座美国主要城市修改 Google Maps,把遇到预设拥堵路段的行程导向行驶时间和路段类型相近的替代路线,不足 2% 的观测行程被改写后,目标路段行驶速度中位数提升约 2%。
Google Research发现,开启推理能让模型召回简单单跳问题上关闭推理时几乎无法得到的事实,机制是计算缓冲和factual priming。对Gemini-2.5 Flash、Pro与Qwen3-32B,等长重复Let me think已明显好于关闭推理,但始终不能完全赶上自然轨迹;相关事实即使在推理关闭时也能挽回大部分增益。
Google Research 在 JAMA Dermatology 本周发表的调查显示,2345 名参与者借助原型 AI 猜出皮肤状况名称的准确率为 23%,高于普通搜索的 8%,而由皮肤科医生给出真实鉴别诊断的 Wizard of Oz 界面达到 36%。