Google DeepMind 推出 Gemini Omni Flash,可用多模态输入生成并对话编辑视频
Introducing Gemini Omni
Google DeepMind 推出 Gemini Omni 家族的首个模型 Gemini Omni Flash,可将图像、音频、视频和文本作为输入生成视频,并用自然语言多轮编辑且保持角色、物理和场景连贯。
官方同时给出对话式编辑、物理与世界知识约束以及SynthID核验路径,读者可以据此判断这款视频模型会怎样进入现有创作流程。
Gemini Omni Flash 是一款可以从任何输入创作任何内容的模型——从视频开始。
去年,Nano Banana 将 Gemini 的智能带入了图像生成与编辑。自那以后,它已帮助数百万人修复老照片、依据草图进行设计,并以从前无法实现的方式将创意可视化。从一开始,我们就将 Gemini 从底层打造为原生多模态,现在我们正迈出下一步。
我们推出 Gemini Omni,让 Gemini 的推理能力与创作能力相遇。Omni 是我们的新模型,可以从任何输入创作任何内容——从视频开始。借助 Omni,你可以将图像、音频、视频和文本组合为输入,并生成基于 Gemini 现实世界知识的高质量视频。你还可以通过对话轻松编辑视频。
今天,我们正在向 Gemini 应用、Google Flow 和 YouTube Shorts 推出 Omni 系列的首个模型:Gemini Omni Flash。未来我们还将支持图像和音频等输出模态。以下是 Omni 的部分独特之处:
通过对话编辑你的视频
Gemini Omni 让你能以更简单的方式编辑视频——使用自然语言。每条指令都建立在上一条之上。你的角色保持一致,物理效果经得起推敲,场景也会记住此前发生的内容。
改变你周围的世界。 改变特定的事物,或改变一切。你的视频会成为你自己永远无法拍摄到的内容的起点。
提示:用气泡制作这座雕塑。
重新构想动作。 拿起你拍摄的视频,只需让 Omni 改变正在发生的事情。编辑动作、加入新的角色或物体,或将某个瞬间变成意想不到的内容。
通过多轮对话打磨你的视频。 改变环境、角度、风格甚至具体细节,同时始终不偏离原始场景的主线。滑动轮播,看看各项编辑如何层层叠加。
让想法变为现实,并以 Gemini 的世界知识为基础
Gemini Omni 不只是构建看起来真实的场景,它还会推理接下来应该发生什么。它将对照物理的直觉理解与 Gemini 在历史、科学和文化背景方面的知识结合起来,弥合从照片级真实感到有意义叙事之间的差距。
创作物理更准确的视觉效果。 Omni 对重力、动能和流体动力学等作用力有了更好的直觉理解,让你能够创作更真实的场景。
提示:一颗弹珠在连锁反应式轨道上快速滚动,连续平滑镜头。
融合知识与创意。 Omni 借助 Gemini 的知识,以远超模式匹配的方式将语言、图像和意义联系起来。
提示:视频展示字母表中的物品。每个字母对应一件不寻常的物品,放在桌子上(例如 C 对应 Capybara,D 对应 disco globe,L 对应 Lava Lamp)。全部 26 个字母必须由 26 件物品呈现,并配有显示该字母的匹配下三分之一字幕。每次只出现一件物品和下三分之一字幕。每个下三分之一字幕必须看起来像用黑色记号笔写在左下角一张纸条上。快速切换,以 24FPS 计算每件物品大约 9 帧。最后一帧是一张写着 "THE END" 的纸条。整段视频配有平静舒缓的音乐。
将复杂想法可视化。 Omni 可以根据简短提示创作引人入胜的讲解内容,生成能够拆解更复杂想法的视觉效果。
提示词:黏土动画讲解蛋白质折叠,一切都由黏土制成,没有手,定格动画,准确
从任意输入组合创建视频
参考任何内容。 Omni 可将任何参考——图像、文本、视频或音频——转化为单一、连贯的输出。音频方面起初仅支持语音参考,我们很快会推出其他类型的音频输入。
从你已有的内容开始。 借助输入参考,你可以使用角色、场景或图画的图像,以符合你构想的方式进行创作。
应用风格、动态或效果。 使用输入参考来定义视觉语言,或直接用自然语言描述。Omni 会融合这些输入参考,创作出连贯的片段。
用你自己的数字分身创建视频
我们致力于负责任地开发 AI,并制定了明确的政策,以保护用户免受伤害并规范我们 AI 工具的使用。首先,你可以使用 Avatars 用自己的声音创建视频,它会创建你的数字版本,让你生成看起来和听起来都像你的视频。除了分身功能之外,在编辑视频以更改音频和语音方面,我们仍在测试,并更好地了解如何负责任地将这项能力带给用户。
所有使用 Omni 创建的视频都包含我们难以察觉的 SynthID 数字水印。你可以通过 Gemini 应用、Chrome 中的 Gemini 以及 Google 搜索,轻松验证视频是否由 Gemini Omni 生成。你可以在我们的博文中进一步了解我们如何扩展内容透明度与验证工具,以帮助你了解网络上的内容是如何被创建和编辑的。
立即试用 Gemini Omni
今天,我们推出 Omni 系列的首个模型——Gemini Omni Flash。Gemini Omni Flash 即日起通过 Gemini 应用和 Google Flow 向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户推出。从本周起,它还将免费向 YouTube Shorts 和 YouTube Create 应用的用户推出。
未来几周,我们还将通过 API 向开发者和企业客户推出。
合集
I/O 2026
以下是我们在 Google I/O 2026 上发布的全部内容。
查看更多
在收件箱中获取来自 Google 的最新资讯
订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠等内容。
你的信息将依照Google 的隐私政策。使用。你可以随时选择退出。
来源:Google DeepMind · deepmind.google