Gemini 3.8 Live 推出 Live Avatar,为企业对话加入近实时视频形象
Gemini 3.8 Live 即日起在 Gemini Enterprise 提供 Live Avatar,把近实时视频生成与语音结合,为对话带来可听、可看、可说的动态视觉形象。
推荐理由:Live Avatar 把近实时视频形象接到 Gemini 3.8 Live 语音对话中,使企业能在不中断交流的情况下后台调用工具并跨 97 种语言同步口型与表情。
Gemini 3.8 Live 即日起在 Gemini Enterprise 提供 Live Avatar,把近实时视频生成与语音结合,为对话带来可听、可看、可说的动态视觉形象。
推荐理由:Live Avatar 把近实时视频形象接到 Gemini 3.8 Live 语音对话中,使企业能在不中断交流的情况下后台调用工具并跨 97 种语言同步口型与表情。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 公开超过 2800 种病毒蛋白复合物的预测三维结构,供各地科学家为未来疫情提前积累结构知识。
Google 将为 Private AI Compute 增加可跨设备的服务端持久记忆,并维持通常限于设备端的严格隐私标准。数据封存在专用加密存储,解锁密钥仅在个人设备上,连 Google 也无法访问。设备发送个人数据前可核验服务器软件真实且未被篡改。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,前者侧重用自然语言从零设计角色声线,后者面向高用量、低成本的配音与语音代理。
推荐理由:Gemini 3.8 的两款新语音模型可用自然语言设计角色声线,并公开基准名次与各端入口,方便对照现有配音和语音代理流程。
Google DeepMind推出AlphaGenome Atlas,预计算人类基因组中约90亿个、即全部可能的单核苷酸变异的分子效应。
推荐理由:AlphaGenome Atlas预计算约90亿种单字母变异效应,读者可用AVI分数同时排序变异并查看剪接或表达等驱动因素。
Google DeepMind与Google Research发布WeatherNext 3,可每小时生成最高5公里分辨率的全球天气预报。相较25公里网格、6小时更新的WeatherNext 2,新模型的全球天气画面约锐利5倍;中期预报早期时效的CRPS相对IMERG最高改善60%,相对MRMS为30%,相对雨量计为10%。
推荐理由:WeatherNext 3将WeatherNext 2的25公里、6小时改为5公里与每小时更新,并接入Search、Gemini和Maps。
Google 启动 Fairwind Program,让政府与可信伙伴借助 Gemini 3.8 Flash Cyber 和 CodeMender 自主修复漏洞。不必再花数周,数分钟内即可在安全云环境生成经验证、可部署的补丁。已有超过 650 家合作伙伴,访问限于内部网络安全、事件响应或渗透测试团队并需多因素认证。
Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。3.8 Flash 沿用 3.7 Flash 的入门价格,输入每百万 token 为 $0.75、输出每百万 token 为 $3.75,并提升软件工程、智能体任务与多步推理,HLE-Verified 达到 54.9%。
推荐理由:3.8 Flash以与3.7相同的价格加强长程编码和多步推理,网络安全变体仅经Fairwind向政府、关键基础设施和软件维护方开放。
Google DeepMind 今天在 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 上线智能体式视频理解,视频分析的 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。
推荐理由:智能体模式让模型按目标选择画面、音频或文字稿并只读取所需片段,长视频分析不必再整段按固定帧率消耗大量 token。
Gemini Omni 1.1 Flash 现已推出,开发者可通过 Gemini API 做场景延续、首尾帧插值和最高 4K 放大。场景延续能分析最多 10 秒前文,而不只参考最后 1 秒,并按 10 秒一段把视频延到累计 40 秒;360p 预览成本为标准 720p 的三分之一,生成最高快 60%,成片可输出 1080p 或 4K。
推荐理由:开发者现在可以用最多10秒前文把已有视频按10秒一段延续到累计40秒,再以360p三分之一的成本和最高快60%的速度试稿后放大到4K。
Google 发布语音转文字模型 Gemini 3.5 Transcribe,可将原始音频直接转为准确、润色并自动排版的文本,并称这是其迄今最精确的语音转写模型。
推荐理由:相对 Chirp 3,新模型给出流式 4.0% 与非流式 2.6% 词错误率以及终稿时间改善 70% 的直接对比。
Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体,距 3.6 Flash 仅三周,入门价为原先每百万 token 成本的一半。
推荐理由:Gemini 3.7 Flash 在 3.6 Flash 发布仅三周后推出,编码调试、网页生成和复杂文档处理基准均有提升,同时入门价定为原先每百万 token 成本的一半。
Google DeepMind发布大规模多语言手语转文本模型SL2T,先在Pixel 11的Gboard和Live Transcribe中把美国手语译成英语听写。
推荐理由:SL2T把超过五十种手语的身体关键点直接译成流式文本,并开始用于Pixel 11听写,读者可以据此了解手语输入如何接进日常打字。
Google DeepMind 的 WeatherNext 在 Nature 论文中显示,气旋路径、强度和风场的三天预报平均达到以往模型两天的水平。该模型用近 20TB 全球大气数据与 IBTrACS 中近 5000 场历史风暴联合训练,今年把集合规模扩至 1000 个成员,可在 TPU 上不到一分钟生成 15 天预报。
推荐理由:三天气旋预报达到以往模型两天的水平,并开源 WeatherNext 2 与气旋模型,预报流程因此多出约一天可准备的时间。
Google DeepMind 今天发布 Gemini Robotics ER 2,将其作为机器人的高层具身推理模型,用于对话、理解物理世界和多步规划,再把运动执行交给下层视觉语言动作模型。
推荐理由:新模型相对 ER 1.6 补上了连续视频中的进度判断与多机协作能力,开发者可把它接到下层动作模型来编排多步实体任务。
Google DeepMind 今日在 Google Flow Music 推出 Lyria 3.5,提升音乐性、歌词、人声质量与创作控制。作为最新音乐生成模型,它能帮助用户做出更丰富的曲目。
Google DeepMind 推出 Gemini Robotics 2,把视觉和语言输入转成电机控制,让完整人形机器人和双臂机器人完成从脚到指尖的全身动作与灵巧操作。
推荐理由:这次更新把原先的桌面上半身操作扩展到全身协调、灵巧操作和多机协作,并说明端侧模型可用数小时数据适配新机体。
Google Research让13917人随机使用五种Gemini Flash 2.0 SymptomAI智能体做症状问诊和鉴别诊断。三名委员会认证临床医生盲评后,在超过50%的案例中更偏好SymptomAI的鉴别诊断,也更常判定其top-5结果包含参与者两周后报告的就医诊断;各主动追问策略均显著优于不追问的基础模型。
推荐理由:13917人的随机研究显示,临床专家在超过50%的案例里更偏好SymptomAI的鉴别诊断,主动追问也优于不追问的基础对话。
Google DeepMind 在 DOE Genesis Mission Summit 2026 宣布,承诺提供价值 $40 million 的 AI token 与云额度,支持 Genesis Mission 的研究人员。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber,用于以更高 token 效率、更低延迟和更可靠表现规模化构建 AI 智能体。
推荐理由:官方把三款新模型相对前代的token用量、速度、价格和基准分数放在一起,便于比较它们在智能体工作流里的成本与能力取舍。
Google 推出 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证并修补漏洞,并在这些任务上比主线 Flash 模型更有效。
Google Research 提出大型传感器基础模型 SensorFM,用五百万名同意参与者超过一万亿分钟的无标签多模态可穿戴信号学习可复用生理表征。
Google DeepMind与A24今天宣布以研究为重点的同类首个合作,帮助艺术家开发新工作流和技术,Google并对A24作出投资。双方将开展跨越多个项目的深度研发,把创新放进创作过程,由A24电影人帮助塑造技术并拓展叙事可能,同时向DeepMind提供艺术家反馈。合作初期聚焦连接前沿技术与下一代娱乐,具体目标、技术产出和创作里程碑将随时间演变。
Google DeepMind 开放 Nano Banana 2 Lite 与 Gemini Omni Flash,分别用于高速图像生成,以及视频生成和对话式编辑。
推荐理由:官方同时给出图像模型的延迟与单价,以及视频模型的按秒定价和时长限制,读者可以据此估算图生视频迭代的成本。
计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可构建在浏览器、移动端和桌面中观察、推理并执行操作的自定义智能体。
推荐理由:原先独立的Gemini 2.5计算机使用模型已并入Gemini 3.5 Flash,开发者可据此构建跨端长程自动化智能体,并选用操作确认与注入拦截。
Google DeepMind发布实验性开源模型DiffusionGemma,这款26B MoE以文本扩散整块并行生成文本,在专用GPU上最高可实现4倍加速。
推荐理由:DiffusionGemma把本地文本生成从逐token解码改成整段并行起草,并交代相对Gemma 4的速度、显存和质量取舍,便于判断它适合哪些交互式本地工作流。
Google 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70 多种语言,并近实时生成保留语调、节奏和音高的语音翻译。
推荐理由:相比轮次等待后再译,Gemini 3.5 Live Translate 会持续出声并落后说话人仅几秒,读者可据此了解它进入翻译应用、Meet 和开发接口后的实时互译方式。
Google DeepMind 发布面向笔记本的 Gemma 4 12B,采用无编码器统一架构,让视觉和音频直接进入 LLM 主干。它是该系列首个支持原生音频输入的中等尺寸模型,标准基准表现接近 26B MoE,总内存不到后者一半,16GB VRAM 或统一内存即可本地运行,以 Apache 2.0 许可发布并配备 MTP drafter。
推荐理由:它位于端侧友好的E4B与更先进的26B MoE之间,用无编码器设计把视觉和音频直接交给语言模型,并以不到一半内存接近更大模型的基准表现。
Google DeepMind的塞拉利昂预注册试验显示,Guided Learning组数学成绩比对照组高0.258个标准差,八周约合1.2到1.7年进度。逾113,000次互动中,91.4%的对话用于建立概念理解,Gemini在76%的消息里提出脚手架问题,只在2%的情形直接给解答;技能建构类提问由首周68%升至末周90%,寻求直接解答的提问由25%降至10%。
推荐理由:塞拉利昂八周试验显示,引导式学习带来0.258个标准差的数学增益,约一半课时使用Gemini的班级约合1.8到2.5年进度。
Google DeepMind 正在亚太启动首期 Accelerator 项目,以 “AI for the Planet” 应对环境风险。这一为期三个月的项目面向区域内的初创公司、研究团队和非营利组织。
Google DeepMind为Project Genie上线Street View实景锚定,创建世界时可选美国地点和风格,使起点绑定真实街景影像。用户可借助Maps Imagery Grounding,例如用Ocean World风格在金门大桥周围潜水,或用B&W film风格查看1920年代的Fort Worth Stockyards。
Google DeepMind 推出 Gemini Omni 家族的首个模型 Gemini Omni Flash,可将图像、音频、视频和文本作为输入生成视频,并用自然语言多轮编辑且保持角色、物理和场景连贯。
推荐理由:官方同时给出对话式编辑、物理与世界知识约束以及SynthID核验路径,读者可以据此判断这款视频模型会怎样进入现有创作流程。
Google 扩展 Search、Gemini、Chrome、Pixel 与 Cloud 的内容透明度与核验工具,帮助用户了解网上内容如何被创建和编辑。
推荐理由:Google 把 SynthID 与内容凭证核验扩到搜索、浏览器和手机,并在云端提供检测接口,方便分辨模型生成内容与相机拍摄原片。
Google DeepMind 与 Google Research 的 AI 天气模型 WeatherNext,在五天前以 80% 置信度预测飓风梅利莎将以五级强度登陆牙买加,帮助国家飓风中心提前预警。
Google DeepMind 发布 Gemini 3.5 模型家族,并开放 Gemini 3.5 Flash,使其成为全球 Gemini 应用和 Google 搜索 AI Mode 的默认模型,同时进入 Google Antigravity、Gemini API 及企业平台。
推荐理由:3.5 Flash已同时向用户、开发者和企业开放,智能体与编码基准超过Gemini 3.1 Pro,可比较其速度和落地范围。
Google DeepMind 在 Nature 发表 Co-Scientist,用 Gemini 多智能体迭代生成、辩论并演化科学假设。在肝纤维化合作中,系统标出的一种药物重定位候选在实验室测试里阻断了 91% 与瘢痕相关的反应。个人研究者可在 labs.google/science 登记兴趣,Hypothesis Generation 实验工具将于未来数周开始推出。
推荐理由:文中把多智能体假设生成拆成提出、辩论与演化三阶段,并说明它如何在肝纤维化等课题里帮助研究者收敛可检验方向。
AlphaEvolve 团队分享了这一 Gemini 驱动编码智能体至今最显著的跨领域影响,应用已从数学和计算机科学扩展到健康、可持续、量子计算、AI 基础设施与商业优化。
推荐理由:把测序纠错、电网求解、量子电路和企业路由等结果放在一起,可以看出这个编码智能体已从算法发现延伸到基础设施与商业优化。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者的 triadic care。在盲测中,医生更偏好 AI co-clinician 而非领先的证据综合工具;98 项基层医疗问询里有 97 例没有关键错误,开放式 OpenFDA RxQA 用药问答也优于其他前沿模型。
Google Photos 的 Auto frame 现已加入拍后重设视角能力,用机器学习理解场景与空间布局,再用生成式 AI 从新机位生成照片。方法先估计三维点图、可见表面和原相机焦距,重点减少人体与面部重建伪影,再渲染调整后的相机位姿和焦距;新露出的区域由潜空间扩散模型补全,并以分类器引导和区域缩放保留原内容。
推荐理由:Google Photos 的 Auto frame 会把已拍照片当作三维场景并自动调整机位,同时补全新视角里原先不可见的内容从而改善人像与广角构图。
Google DeepMind发布Gemini 3.1 Flash TTS,用可嵌入文本的音频标签控制风格、语速与表达。该模型即日起向开发者通过Gemini API和Google AI Studio预览,企业通过Vertex AI预览,Workspace用户可通过Google Vids使用。
推荐理由:开发者可以把自然语言音频标签直接写进文本,在句中切换语气和语速,再将同样的参数导出为Gemini API代码,以便在不同项目中保持一致音色。