Gemini 3.8 Live 推出 Live Avatar,为企业对话加入近实时视频形象
Gemini 3.8 Live 即日起在 Gemini Enterprise 提供 Live Avatar,把近实时视频生成与语音结合,为对话带来可听、可看、可说的动态视觉形象。
推荐理由:Live Avatar 把近实时视频形象接到 Gemini 3.8 Live 语音对话中,使企业能在不中断交流的情况下后台调用工具并跨 97 种语言同步口型与表情。
Gemini 3.8 Live 即日起在 Gemini Enterprise 提供 Live Avatar,把近实时视频生成与语音结合,为对话带来可听、可看、可说的动态视觉形象。
推荐理由:Live Avatar 把近实时视频形象接到 Gemini 3.8 Live 语音对话中,使企业能在不中断交流的情况下后台调用工具并跨 97 种语言同步口型与表情。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 公开超过 2800 种病毒蛋白复合物的预测三维结构,供各地科学家为未来疫情提前积累结构知识。
Google 将为 Private AI Compute 增加可跨设备的服务端持久记忆,并维持通常限于设备端的严格隐私标准。数据封存在专用加密存储,解锁密钥仅在个人设备上,连 Google 也无法访问。设备发送个人数据前可核验服务器软件真实且未被篡改。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,前者侧重用自然语言从零设计角色声线,后者面向高用量、低成本的配音与语音代理。
推荐理由:Gemini 3.8 的两款新语音模型可用自然语言设计角色声线,并公开基准名次与各端入口,方便对照现有配音和语音代理流程。
Google DeepMind推出AlphaGenome Atlas,预计算人类基因组中约90亿个、即全部可能的单核苷酸变异的分子效应。
推荐理由:AlphaGenome Atlas预计算约90亿种单字母变异效应,读者可用AVI分数同时排序变异并查看剪接或表达等驱动因素。
Google DeepMind与Google Research发布WeatherNext 3,可每小时生成最高5公里分辨率的全球天气预报。相较25公里网格、6小时更新的WeatherNext 2,新模型的全球天气画面约锐利5倍;中期预报早期时效的CRPS相对IMERG最高改善60%,相对MRMS为30%,相对雨量计为10%。
推荐理由:WeatherNext 3将WeatherNext 2的25公里、6小时改为5公里与每小时更新,并接入Search、Gemini和Maps。
Google 启动 Fairwind Program,让政府与可信伙伴借助 Gemini 3.8 Flash Cyber 和 CodeMender 自主修复漏洞。不必再花数周,数分钟内即可在安全云环境生成经验证、可部署的补丁。已有超过 650 家合作伙伴,访问限于内部网络安全、事件响应或渗透测试团队并需多因素认证。
Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。3.8 Flash 沿用 3.7 Flash 的入门价格,输入每百万 token 为 $0.75、输出每百万 token 为 $3.75,并提升软件工程、智能体任务与多步推理,HLE-Verified 达到 54.9%。
推荐理由:3.8 Flash以与3.7相同的价格加强长程编码和多步推理,网络安全变体仅经Fairwind向政府、关键基础设施和软件维护方开放。
Google DeepMind 今天在 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 上线智能体式视频理解,视频分析的 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。
推荐理由:智能体模式让模型按目标选择画面、音频或文字稿并只读取所需片段,长视频分析不必再整段按固定帧率消耗大量 token。
Gemini Omni 1.1 Flash 现已推出,开发者可通过 Gemini API 做场景延续、首尾帧插值和最高 4K 放大。场景延续能分析最多 10 秒前文,而不只参考最后 1 秒,并按 10 秒一段把视频延到累计 40 秒;360p 预览成本为标准 720p 的三分之一,生成最高快 60%,成片可输出 1080p 或 4K。
推荐理由:开发者现在可以用最多10秒前文把已有视频按10秒一段延续到累计40秒,再以360p三分之一的成本和最高快60%的速度试稿后放大到4K。
Google 发布语音转文字模型 Gemini 3.5 Transcribe,可将原始音频直接转为准确、润色并自动排版的文本,并称这是其迄今最精确的语音转写模型。
推荐理由:相对 Chirp 3,新模型给出流式 4.0% 与非流式 2.6% 词错误率以及终稿时间改善 70% 的直接对比。
Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体,距 3.6 Flash 仅三周,入门价为原先每百万 token 成本的一半。
推荐理由:Gemini 3.7 Flash 在 3.6 Flash 发布仅三周后推出,编码调试、网页生成和复杂文档处理基准均有提升,同时入门价定为原先每百万 token 成本的一半。
Google DeepMind发布大规模多语言手语转文本模型SL2T,先在Pixel 11的Gboard和Live Transcribe中把美国手语译成英语听写。
推荐理由:SL2T把超过五十种手语的身体关键点直接译成流式文本,并开始用于Pixel 11听写,读者可以据此了解手语输入如何接进日常打字。
Google DeepMind 的 WeatherNext 在 Nature 论文中显示,气旋路径、强度和风场的三天预报平均达到以往模型两天的水平。该模型用近 20TB 全球大气数据与 IBTrACS 中近 5000 场历史风暴联合训练,今年把集合规模扩至 1000 个成员,可在 TPU 上不到一分钟生成 15 天预报。
推荐理由:三天气旋预报达到以往模型两天的水平,并开源 WeatherNext 2 与气旋模型,预报流程因此多出约一天可准备的时间。
Google DeepMind 今天发布 Gemini Robotics ER 2,将其作为机器人的高层具身推理模型,用于对话、理解物理世界和多步规划,再把运动执行交给下层视觉语言动作模型。
推荐理由:新模型相对 ER 1.6 补上了连续视频中的进度判断与多机协作能力,开发者可把它接到下层动作模型来编排多步实体任务。
Google DeepMind 今日在 Google Flow Music 推出 Lyria 3.5,提升音乐性、歌词、人声质量与创作控制。作为最新音乐生成模型,它能帮助用户做出更丰富的曲目。
Google DeepMind 推出 Gemini Robotics 2,把视觉和语言输入转成电机控制,让完整人形机器人和双臂机器人完成从脚到指尖的全身动作与灵巧操作。
推荐理由:这次更新把原先的桌面上半身操作扩展到全身协调、灵巧操作和多机协作,并说明端侧模型可用数小时数据适配新机体。
Google Research让13917人随机使用五种Gemini Flash 2.0 SymptomAI智能体做症状问诊和鉴别诊断。三名委员会认证临床医生盲评后,在超过50%的案例中更偏好SymptomAI的鉴别诊断,也更常判定其top-5结果包含参与者两周后报告的就医诊断;各主动追问策略均显著优于不追问的基础模型。
推荐理由:13917人的随机研究显示,临床专家在超过50%的案例里更偏好SymptomAI的鉴别诊断,主动追问也优于不追问的基础对话。
Google DeepMind 在 DOE Genesis Mission Summit 2026 宣布,承诺提供价值 $40 million 的 AI token 与云额度,支持 Genesis Mission 的研究人员。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber,用于以更高 token 效率、更低延迟和更可靠表现规模化构建 AI 智能体。
推荐理由:官方把三款新模型相对前代的token用量、速度、价格和基准分数放在一起,便于比较它们在智能体工作流里的成本与能力取舍。
Google 推出 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证并修补漏洞,并在这些任务上比主线 Flash 模型更有效。
Google Research 提出大型传感器基础模型 SensorFM,用五百万名同意参与者超过一万亿分钟的无标签多模态可穿戴信号学习可复用生理表征。
Google DeepMind与A24今天宣布以研究为重点的同类首个合作,帮助艺术家开发新工作流和技术,Google并对A24作出投资。双方将开展跨越多个项目的深度研发,把创新放进创作过程,由A24电影人帮助塑造技术并拓展叙事可能,同时向DeepMind提供艺术家反馈。合作初期聚焦连接前沿技术与下一代娱乐,具体目标、技术产出和创作里程碑将随时间演变。
Google DeepMind 开放 Nano Banana 2 Lite 与 Gemini Omni Flash,分别用于高速图像生成,以及视频生成和对话式编辑。
推荐理由:官方同时给出图像模型的延迟与单价,以及视频模型的按秒定价和时长限制,读者可以据此估算图生视频迭代的成本。
计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可构建在浏览器、移动端和桌面中观察、推理并执行操作的自定义智能体。
推荐理由:原先独立的Gemini 2.5计算机使用模型已并入Gemini 3.5 Flash,开发者可据此构建跨端长程自动化智能体,并选用操作确认与注入拦截。
Google DeepMind发布实验性开源模型DiffusionGemma,这款26B MoE以文本扩散整块并行生成文本,在专用GPU上最高可实现4倍加速。
推荐理由:DiffusionGemma把本地文本生成从逐token解码改成整段并行起草,并交代相对Gemma 4的速度、显存和质量取舍,便于判断它适合哪些交互式本地工作流。