跳到正文

#Google

今日 0 条
9月25日周五
  1. Google Research50

    Google Research 介绍自动生成连贯长视频的 AI 协同导演框架

    Google Research 介绍基于 Gemini 与 Veo 的 AI 视频协同导演,用多智能体编排规划多镜头长视频的视觉连续性。该套件包括将于 COLM 2026 发表的 Co-Director、将于 EMNLP 2026 发表的 CANVAS,以及 A²RD 与 VQQA,分别处理创意配置、持久视觉记忆、分段生成和提示词闭环修正,并继承 SynthID 水印。

  2. Google DeepMind60

    Gemini 3.8 Live 推出 Live Avatar,为企业对话加入近实时视频形象

    Gemini 3.8 Live 即日起在 Gemini Enterprise 提供 Live Avatar,把近实时视频生成与语音结合,为对话带来可听、可看、可说的动态视觉形象。

    推荐理由:Live Avatar 把近实时视频形象接到 Gemini 3.8 Live 语音对话中,使企业能在不中断交流的情况下后台调用工具并跨 97 种语言同步口型与表情。

9月24日周四
9月23日周三
  1. Google DeepMind71

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,前者侧重用自然语言从零设计角色声线,后者面向高用量、低成本的配音与语音代理。

    推荐理由:Gemini 3.8 的两款新语音模型可用自然语言设计角色声线,并公开基准名次与各端入口,方便对照现有配音和语音代理流程。

9月19日周六
9月18日周五
9月16日周三
9月8日周二
9月4日周五
9月3日周四
  1. Google DeepMind73

    Google DeepMind与Google Research发布全球天气模型WeatherNext 3

    Google DeepMind与Google Research发布WeatherNext 3,可每小时生成最高5公里分辨率的全球天气预报。相较25公里网格、6小时更新的WeatherNext 2,新模型的全球天气画面约锐利5倍;中期预报早期时效的CRPS相对IMERG最高改善60%,相对MRMS为30%,相对雨量计为10%。

    推荐理由:WeatherNext 3将WeatherNext 2的25公里、6小时改为5公里与每小时更新,并接入Search、Gemini和Maps。

  2. Google DeepMind77

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。3.8 Flash 沿用 3.7 Flash 的入门价格,输入每百万 token 为 $0.75、输出每百万 token 为 $3.75,并提升软件工程、智能体任务与多步推理,HLE-Verified 达到 54.9%。

    推荐理由:3.8 Flash以与3.7相同的价格加强长程编码和多步推理,网络安全变体仅经Fairwind向政府、关键基础设施和软件维护方开放。

9月2日周三
  1. Google DeepMind69

    Gemini 3.7 Flash 等模型上线智能体式视频理解

    Google DeepMind 今天在 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 上线智能体式视频理解,视频分析的 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。

    推荐理由:智能体模式让模型按目标选择画面、音频或文字稿并只读取所需片段,长视频分析不必再整段按固定帧率消耗大量 token。

9月1日周二
8月28日周五
  1. Google DeepMind63

    Google DeepMind 推出 Gemini Omni 1.1 Flash,强化生成视频控制

    Gemini Omni 1.1 Flash 现已推出,开发者可通过 Gemini API 做场景延续、首尾帧插值和最高 4K 放大。场景延续能分析最多 10 秒前文,而不只参考最后 1 秒,并按 10 秒一段把视频延到累计 40 秒;360p 预览成本为标准 720p 的三分之一,生成最高快 60%,成片可输出 1080p 或 4K。

    推荐理由:开发者现在可以用最多10秒前文把已有视频按10秒一段延续到累计40秒,再以360p三分之一的成本和最高快60%的速度试稿后放大到4K。

8月27日周四
8月14日周五
8月12日周三
  1. Google Research60

    Google Research 指出前沿大语言模型事实性瓶颈在于召回而非编码

    Google Research 提出知识画像,发现前沿大语言模型的许多事实错误是召回失败,而不是事实未被编码。基于 2,150 条维基事实的 WikiProfile 显示,Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,但仍有 26–34% 无法直接召回,开启思考后失败比例为 11–12%。

    推荐理由:用知识画像同时衡量事实的编码和召回后,前沿模型的事实性短板更集中于已经写入参数却难以稳定取出的知识。

  2. Google Research67

    Google Research 推进 AMIE 实时视频问诊,模拟研究中与全科医生评分相当

    Google Research 展示基于 Gemini 与 Project Astra 的 AMIE(Video),在100个情景、300次模拟实时视频问诊中,被20名全科医生评为在病史采集、诊断准确性、处置适当性和沟通质量上与10名视频问诊全科医生相当。

    推荐理由:随机研究把AMIE视频版、纯文本版和全科医生放在同一评分框架下,从而呈现视听观察和虚拟查体的评分差异以及演员模拟边界。

8月6日周四
  1. Google DeepMind71

    Google DeepMind 的 WeatherNext 实现气旋预报突破,三天精度相当于以往两天

    Google DeepMind 的 WeatherNext 在 Nature 论文中显示,气旋路径、强度和风场的三天预报平均达到以往模型两天的水平。该模型用近 20TB 全球大气数据与 IBTrACS 中近 5000 场历史风暴联合训练,今年把集合规模扩至 1000 个成员,可在 TPU 上不到一分钟生成 15 天预报。

    推荐理由:三天气旋预报达到以往模型两天的水平,并开源 WeatherNext 2 与气旋模型,预报流程因此多出约一天可准备的时间。

7月31日周五
7月30日周四
  1. Google DeepMind63

    Google DeepMind 发布 Gemini Robotics ER 2,强化视频理解、任务编排与多机器人协作

    Google DeepMind 今天发布 Gemini Robotics ER 2,将其作为机器人的高层具身推理模型,用于对话、理解物理世界和多步规划,再把运动执行交给下层视觉语言动作模型。

    推荐理由:新模型相对 ER 1.6 补上了连续视频中的进度判断与多机协作能力,开发者可把它接到下层动作模型来编排多步实体任务。

7月28日周二
  1. Google DeepMind69

    Gemini Robotics 2 为机器人带来全身控制、灵巧操作与多机协作

    Google DeepMind 推出 Gemini Robotics 2,把视觉和语言输入转成电机控制,让完整人形机器人和双臂机器人完成从脚到指尖的全身动作与灵巧操作。

    推荐理由:这次更新把原先的桌面上半身操作扩展到全身协调、灵巧操作和多机协作,并说明端侧模型可用数小时数据适配新机体。

7月23日周四
  1. Google Research68

    Google Research分享SymptomAI日常症状评估对话研究结果

    Google Research让13917人随机使用五种Gemini Flash 2.0 SymptomAI智能体做症状问诊和鉴别诊断。三名委员会认证临床医生盲评后,在超过50%的案例中更偏好SymptomAI的鉴别诊断,也更常判定其top-5结果包含参与者两周后报告的就医诊断;各主动追问策略均显著优于不追问的基础模型。

    推荐理由:13917人的随机研究显示,临床专家在超过50%的案例里更偏好SymptomAI的鉴别诊断,主动追问也优于不追问的基础对话。

7月22日周三
7月21日周二
7月17日周五
7月9日周四
7月8日周三
7月3日周五
  1. Google DeepMind50

    Google DeepMind与A24宣布研究合作,Google已投资A24

    Google DeepMind与A24今天宣布以研究为重点的同类首个合作,帮助艺术家开发新工作流和技术,Google并对A24作出投资。双方将开展跨越多个项目的深度研发,把创新放进创作过程,由A24电影人帮助塑造技术并拓展叙事可能,同时向DeepMind提供艺术家反馈。合作初期聚焦连接前沿技术与下一代娱乐,具体目标、技术产出和创作里程碑将随时间演变。

7月1日周三
6月30日周二
  1. Google Research62

    Google Research 推出零样本表格基础模型 TabFM

    Google Research 推出零样本表格基础模型 TabFM,一次前向即可对未见过的表做分类和回归,无需逐表训练、调参和特征工程。它把整张表当作统一提示,用行列交替注意力、行压缩和 Transformer 做上下文学习,全部基于数亿个结构因果模型合成的数据集预训练。

    推荐理由:把表格预测改写成上下文学习之后,读者可以对照传统树模型流程判断单次前向能否省掉调参和特征工程。

6月25日周四
  1. Google Research54

    推理如何解锁大语言模型中的参数知识

    Google Research发现,开启推理能让模型召回简单单跳问题上关闭推理时几乎无法得到的事实,机制是计算缓冲和factual priming。对Gemini-2.5 Flash、Pro与Qwen3-32B,等长重复Let me think已明显好于关闭推理,但始终不能完全赶上自然轨迹;相关事实即使在推理关闭时也能挽回大部分增益。

  2. Google DeepMind72

    Gemini 3.5 Flash 内置计算机使用以构建跨平台智能体

    计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可构建在浏览器、移动端和桌面中观察、推理并执行操作的自定义智能体。

    推荐理由:原先独立的Gemini 2.5计算机使用模型已并入Gemini 3.5 Flash,开发者可据此构建跨端长程自动化智能体,并选用操作确认与注入拦截。