跳到正文
原文
Google DeepMind·· 2026-08-28精选AI 评分63

Google DeepMind 推出 Gemini Omni 1.1 Flash,强化生成视频控制

Gemini Omni 1.1 Flash lets you build with more control

AI 导读

Gemini Omni 1.1 Flash 现已推出,开发者可通过 Gemini API 做场景延续、首尾帧插值和最高 4K 放大。场景延续能分析最多 10 秒前文,而不只参考最后 1 秒,并按 10 秒一段把视频延到累计 40 秒;360p 预览成本为标准 720p 的三分之一,生成最高快 60%,成片可输出 1080p 或 4K。

推荐理由

开发者现在可以用最多10秒前文把已有视频按10秒一段延续到累计40秒,再以360p三分之一的成本和最高快60%的速度试稿后放大到4K。

正文 · AI 翻译

Aug 27, 2026

|

Omni 现已提供影棚级视频制作能力,包括延长场景、首尾帧插值、清晰的 4K 放大、更快的原型制作等。


Anish Nangia

产品经理,Google DeepMind

Alisa Fortin

产品经理,Google DeepMind


Text "Gemini Omni 1.1 Flash Available via APIs" surrounded by various images of people and a squirrel

收听文章

[[duration]] 分钟

此内容由 Google AI 生成。生成式 AI 尚处于实验阶段

今天,我们推出 Gemini Omni 1.1 Flash,这是一套支持开发者的全新创意控制与生成式视频能力。Gemini Omni 将现实世界推理引入生成式创作,而今天的更新使 Omni 1.1 可通过 Google AI Studio 中的 Gemini API 达到专业用途的生产就绪状态。

无论你正在构建生成式视频工作流、创意工具还是媒体编辑软件,这些更新都让生成式视频更可控、迭代更快,并经过打磨以用于真实世界部署。以下是新功能一览:

延长场景,实现更长的叙事

场景延长让你可以选取一段现有视频,并从结束处无缝继续生成画面。

借助 Omni 1.1,模型现在最多可以分析 10 秒的先前上下文——这是相较以往仅参考最后一秒的模型的一次飞跃。其结果是视觉一致性与叙事贴合度得到提升,让你能够构建更长的故事,或分支进入新的创意方向。你可以按 10 秒为增量延长视频,累计总长度最高可达 40 秒。

以下是如何使用 Gemini API 延长场景:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
    previous_interaction_id=previous_video_interaction.id,
    input=[
        {"type": "text", "text": "Continue the scene."}
    ],
    response_format={
        "resolution": "360p",
    },
)

指定首帧和尾帧

通过指定镜头的起始帧和结束帧,实现平滑转场与摄像机运动。Omni 1.1 会在两个关键帧之间生成连续视频,非常适合复杂的环绕运镜、变焦转场或无缝循环片段。

提示 1:大礼堂内,一名身穿米色西装的时尚鼓手以低角度特写演奏一套红色架子鼓;镜头快速横摇到一侧,露出一位年长的萨克斯风手正在演奏,身旁一位身着白色服装的芭蕾舞者在柔和的紫色舞台灯光下旋转。一个连续镜头,无跳切。

提示 2:摄像机推进电视屏幕,我们看到与开头相同的女性和相同的场景。无缝视频。一个连续镜头,无跳切。

以 360p 更高效地草拟视频

以 360p 分辨率生成轻量级预览,速度最高可比 Omni 1.1 的标准 720p 分辨率快 60%*,成本仅为三分之一。这有助于快速原型制作、分镜迭代,以及在开发者平台中快速渲染。

*生成速度最高快 60%,依据 360p 与 720p 分辨率的系统吞吐量对比

提示:虹彩海洋硅藻的显微视图,展现精致的玻璃状二氧化硅壳体,具有令人惊叹的自然对称。色彩从深火山琥珀色和暖铜色,到鲜艳的绿松石色和紫色,仿效大地与海洋的丰富色调。微小精致的结构在干净的暗场背景上柔和发光。高保真科学成像、锐利细节、有机纹理、显微摄影。在整个视频中保持显微镜镜头效果。

最高放大至 4K 分辨率

借助 Omni 1.1,生成经过打磨、可用于专业制作的高分辨率 1080p 或 4K 输出。

提示 1:鱼在游动,跟踪镜头

Prompt 2:一只小花栗鼠从屏幕左侧的树林中窜出,好奇地嗅着空气,然后从右侧冲出画面

Prompt 3:电影感微距特写,纤细枝条上鲜艳的金橙色日本枫叶在柔和而富有节奏的秋风中轻轻沙沙作响、摇曳。阳光透过半透明的叶片,营造出温暖的发光效果。浅景深,梦幻散景背景,超精细纹理,照片级真实,4k。

在多模态输入中添加视频参考

构建场景时最多参考三秒视频,以便根据视频参考保持视觉上下文和角色一致性。

Prompt:使用上传的三段舞者视频,并将他们替换为所提供的角色。让他们在所提供图像中的宽敞开阔空间里,一起表演参考视频中各自的舞蹈。

狗角色 dog.png 应表演 dance3.mp4 中的古典舞。章鱼 octo.png 应表演 dance1.mp4 中的嘻哈舞,熊 bear.png 应表演 dance2.mp4 中的霹雳舞。最终结果应为一个连续镜头,没有场景切换。

关于你可以构建什么的启发性构想

以下是一些想法,展示开发者如何在自定义工具和创意工作流中将这些新能力付诸实践。

看看客户如何将 Omni Flash 投入生产

我们的客户已经通过 Agent Platform API,借助 Gemini Omni Flash 推动真实世界的生产。浏览他们创作的视频,并在下方了解他们如何使用该模型。

立即使用 Gemini Omni 1.1 Flash 进行构建

Gemini Omni 1.1 Flash 的价格表。

A table with pricing numbers for the Gemini Omni 1.1 Flash model.

Omni 1.1 正在整个 Google 开发者生态系统中推出:

  • 在 Google AI Studio 中开始构建:直接在 Google AI Studio中试用 Omni 1.1。
  • 在 Gemini Enterprise Agent Platform 上构建:企业可通过 Agent Platform API 直接使用 Omni 1.1 进行构建。
  • 探索开发者文档:查看 官方文档、cookbook 和 提示指南,了解如何将场景扩展、视频参考和放大集成到你的应用中。

从今天起,Omni 1.1 也可供全球所有 Google AI Plus、Pro 和 Ultra 订阅用户在 Google Flow 中使用。场景扩展可供全球所有 Google AI Plus、Pro 和 Ultra 订阅用户在 Gemini 应用中使用。

在收件箱中获取来自 Google 的最新资讯

订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠等内容。

你的信息将按照Google 的隐私政策。使用。你可以随时选择退出。

来源:Google DeepMind · deepmind.google