跳到正文

#Google

今日 0 条
9月25日周五
  1. Google Research50

    Google Research 介绍自动生成连贯长视频的 AI 协同导演框架

    Google Research 介绍基于 Gemini 与 Veo 的 AI 视频协同导演,用多智能体编排规划多镜头长视频的视觉连续性。该套件包括将于 COLM 2026 发表的 Co-Director、将于 EMNLP 2026 发表的 CANVAS,以及 A²RD 与 VQQA,分别处理创意配置、持久视觉记忆、分段生成和提示词闭环修正,并继承 SynthID 水印。

9月24日周四
9月19日周六
9月18日周五
9月16日周三
9月4日周五
9月2日周三
8月28日周五
8月12日周三
  1. Google Research60

    Google Research 指出前沿大语言模型事实性瓶颈在于召回而非编码

    Google Research 提出知识画像,发现前沿大语言模型的许多事实错误是召回失败,而不是事实未被编码。基于 2,150 条维基事实的 WikiProfile 显示,Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,但仍有 26–34% 无法直接召回,开启思考后失败比例为 11–12%。

    推荐理由:用知识画像同时衡量事实的编码和召回后,前沿模型的事实性短板更集中于已经写入参数却难以稳定取出的知识。

  2. Google Research67

    Google Research 推进 AMIE 实时视频问诊,模拟研究中与全科医生评分相当

    Google Research 展示基于 Gemini 与 Project Astra 的 AMIE(Video),在100个情景、300次模拟实时视频问诊中,被20名全科医生评为在病史采集、诊断准确性、处置适当性和沟通质量上与10名视频问诊全科医生相当。

    推荐理由:随机研究把AMIE视频版、纯文本版和全科医生放在同一评分框架下,从而呈现视听观察和虚拟查体的评分差异以及演员模拟边界。

7月31日周五
7月23日周四
  1. Google Research68

    Google Research分享SymptomAI日常症状评估对话研究结果

    Google Research让13917人随机使用五种Gemini Flash 2.0 SymptomAI智能体做症状问诊和鉴别诊断。三名委员会认证临床医生盲评后,在超过50%的案例中更偏好SymptomAI的鉴别诊断,也更常判定其top-5结果包含参与者两周后报告的就医诊断;各主动追问策略均显著优于不追问的基础模型。

    推荐理由:13917人的随机研究显示,临床专家在超过50%的案例里更偏好SymptomAI的鉴别诊断,主动追问也优于不追问的基础对话。

7月9日周四
7月8日周三
6月25日周四
  1. Google Research54

    推理如何解锁大语言模型中的参数知识

    Google Research发现,开启推理能让模型召回简单单跳问题上关闭推理时几乎无法得到的事实,机制是计算缓冲和factual priming。对Gemini-2.5 Flash、Pro与Qwen3-32B,等长重复Let me think已明显好于关闭推理,但始终不能完全赶上自然轨迹;相关事实即使在推理关闭时也能挽回大部分增益。

6月13日周六