跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 21–40 条 · 共 40 条
6月25日周四
  1. Google DeepMind72

    Gemini 3.5 Flash 内置计算机使用以构建跨平台智能体

    计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可构建在浏览器、移动端和桌面中观察、推理并执行操作的自定义智能体。

    推荐理由:原先独立的Gemini 2.5计算机使用模型已并入Gemini 3.5 Flash,开发者可据此构建跨端长程自动化智能体,并选用操作确认与注入拦截。

6月11日周四
  1. Google DeepMind70

    Google DeepMind发布实验性开源模型DiffusionGemma,文本生成最高快4倍

    Google DeepMind发布实验性开源模型DiffusionGemma,这款26B MoE以文本扩散整块并行生成文本,在专用GPU上最高可实现4倍加速。

    推荐理由:DiffusionGemma把本地文本生成从逐token解码改成整段并行起草,并交代相对Gemma 4的速度、显存和质量取舍,便于判断它适合哪些交互式本地工作流。

6月9日周二
  1. Google DeepMind73

    Google 发布 Gemini 3.5 Live Translate,支持 70 多种语言近实时语音翻译

    Google 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70 多种语言,并近实时生成保留语调、节奏和音高的语音翻译。

    推荐理由:相比轮次等待后再译,Gemini 3.5 Live Translate 会持续出声并落后说话人仅几秒,读者可据此了解它进入翻译应用、Meet 和开发接口后的实时互译方式。

  2. Google DeepMind76

    Google DeepMind 发布无编码器统一多模态模型 Gemma 4 12B

    Google DeepMind 发布面向笔记本的 Gemma 4 12B,采用无编码器统一架构,让视觉和音频直接进入 LLM 主干。它是该系列首个支持原生音频输入的中等尺寸模型,标准基准表现接近 26B MoE,总内存不到后者一半,16GB VRAM 或统一内存即可本地运行,以 Apache 2.0 许可发布并配备 MTP drafter。

    推荐理由:它位于端侧友好的E4B与更先进的26B MoE之间,用无编码器设计把视觉和音频直接交给语言模型,并以不到一半内存接近更大模型的基准表现。

6月8日周一
  1. Google DeepMind60

    Google DeepMind衡量Gemini引导式学习在塞拉利昂的影响

    Google DeepMind的塞拉利昂预注册试验显示,Guided Learning组数学成绩比对照组高0.258个标准差,八周约合1.2到1.7年进度。逾113,000次互动中,91.4%的对话用于建立概念理解,Gemini在76%的消息里提出脚手架问题,只在2%的情形直接给解答;技能建构类提问由首周68%升至末周90%,寻求直接解答的提问由25%降至10%。

    推荐理由:塞拉利昂八周试验显示,引导式学习带来0.258个标准差的数学增益,约一半课时使用Gemini的班级约合1.8到2.5年进度。

6月5日周五
5月20日周三
5月18日周一
  1. Google DeepMind79

    Google DeepMind 推出 Gemini Omni Flash,可用多模态输入生成并对话编辑视频

    Google DeepMind 推出 Gemini Omni 家族的首个模型 Gemini Omni Flash,可将图像、音频、视频和文本作为输入生成视频,并用自然语言多轮编辑且保持角色、物理和场景连贯。

    推荐理由:官方同时给出对话式编辑、物理与世界知识约束以及SynthID核验路径,读者可以据此判断这款视频模型会怎样进入现有创作流程。

5月17日周日
5月16日周六
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.5 并开放 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型家族,并开放 Gemini 3.5 Flash,使其成为全球 Gemini 应用和 Google 搜索 AI Mode 的默认模型,同时进入 Google Antigravity、Gemini API 及企业平台。

    推荐理由:3.5 Flash已同时向用户、开发者和企业开放,智能体与编码基准超过Gemini 3.1 Pro,可比较其速度和落地范围。

5月12日周二
  1. Google DeepMind64

    Google DeepMind 在 Nature 发表 Co-Scientist 多智能体科研系统

    Google DeepMind 在 Nature 发表 Co-Scientist,用 Gemini 多智能体迭代生成、辩论并演化科学假设。在肝纤维化合作中,系统标出的一种药物重定位候选在实验室测试里阻断了 91% 与瘢痕相关的反应。个人研究者可在 labs.google/science 登记兴趣,Hypothesis Generation 实验工具将于未来数周开始推出。

    推荐理由:文中把多智能体假设生成拆成提出、辩论与演化三阶段,并说明它如何在肝纤维化等课题里帮助研究者收敛可检验方向。

5月6日周三
  1. Google DeepMind63

    AlphaEvolve 如何以 Gemini 驱动的编码智能体扩大跨领域影响

    AlphaEvolve 团队分享了这一 Gemini 驱动编码智能体至今最显著的跨领域影响,应用已从数学和计算机科学扩展到健康、可持续、量子计算、AI 基础设施与商业优化。

    推荐理由:把测序纠错、电网求解、量子电路和企业路由等结果放在一起,可以看出这个编码智能体已从算法发现延伸到基础设施与商业优化。

4月23日周四
  1. Google Research65

    Google Photos 的 Auto frame 支持拍后重设照片视角

    Google Photos 的 Auto frame 现已加入拍后重设视角能力,用机器学习理解场景与空间布局,再用生成式 AI 从新机位生成照片。方法先估计三维点图、可见表面和原相机焦距,重点减少人体与面部重建伪影,再渲染调整后的相机位姿和焦距;新露出的区域由潜空间扩散模型补全,并以分类器引导和区域缩放保留原内容。

    推荐理由:Google Photos 的 Auto frame 会把已拍照片当作三维场景并自动调整机位,同时补全新视角里原先不可见的内容从而改善人像与广角构图。

4月16日周四
  1. Google DeepMind63

    Google DeepMind 发布 Gemini 3.1 Flash TTS,可用音频标签控制语音表达

    Google DeepMind发布Gemini 3.1 Flash TTS,用可嵌入文本的音频标签控制风格、语速与表达。该模型即日起向开发者通过Gemini API和Google AI Studio预览,企业通过Vertex AI预览,Workspace用户可通过Google Vids使用。

    推荐理由:开发者可以把自然语言音频标签直接写进文本,在句中切换语气和语速,再将同样的参数导出为Gemini API代码,以便在不同项目中保持一致音色。

4月13日周一
  1. Google DeepMind63

    Google DeepMind 发布 Gemini Robotics-ER 1.6,强化具身推理与仪表读数

    Google DeepMind 发布 Gemini Robotics-ER 1.6,将其作为机器人的高层推理模型,强化空间与物理推理、多视角理解及任务成功检测,并新增仪表读数。

    推荐理由:新版相对 Gemini Robotics-ER 1.5 与 Gemini 3.0 Flash 强化了空间指向、物体计数、多视角成功检测以及仪表读数能力,开发者现可在 Gemini API 与 Google AI Studio 中直接配置调用。

4月3日周五
3月29日周日
  1. Google DeepMind60

    Google DeepMind 重新构想由 Gemini 驱动的 AI 鼠标指针

    Google DeepMind 正探索由 Gemini 驱动的 AI 鼠标指针,让系统理解用户所指内容及其重要性,从而在现有工具中直接协作。他们提出保持流程、看图说明、用简短指代配合语音,以及把像素变成可操作实体四项原则。

    推荐理由:文中提出四条交互原则,说明指针如何在当前工具里理解所指内容,把详细提示和跨窗口搬运换成指向与口语。

3月18日周三
  1. Google Research68

    Google Research 两项研究评估 AI 改进英国乳腺癌筛查流程

    Google Research 与多家 NHS 机构合作开展 AIMS 研究,并在 Nature Cancer 发表两项配套论文,评估 AI 乳腺癌检测系统的独立性能及其作为第二阅片人的流程效果。

    推荐理由:用同一随访窗口比较AI独立检测和作为第二阅片人的流程,可以看到检出与人工阅片负担的变化,以及仲裁推翻正确召回的风险。

3月12日周四
  1. Google Research60

    Google Research 探讨 AMIE 对话式诊断在真实临床研究中的可行性

    Google Research 与 BIDMC 完成一项前瞻性单中心可行性研究,由 AMIE 在非急诊基层门诊就诊前,经医师实时监督以文本对话采集病史。

    推荐理由:这项真实门诊研究以盲评比较受监督的 AMIE 诊前问诊和主诊医生,显示鉴别诊断质量接近而管理方案实用性与成本效益由医生更好。