Gemini 3.7 Flash 等模型上线智能体式视频理解
Introducing agentic video understanding with Gemini
Google DeepMind 今天在 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 上线智能体式视频理解,视频分析的 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。
智能体模式让模型按目标选择画面、音频或文字稿并只读取所需片段,长视频分析不必再整段按固定帧率消耗大量 token。
Sep 01, 2026
|
我们全新的智能体视频分析功能可将 token 消耗最多降低 88%,将成本最多降低 66%,并将质量最多提升 7%。
Rohan Doshi
Google DeepMind 高级产品经理
Mario Lučić
Google DeepMind 研究总监
收听文章
[[duration]] 分钟
本内容由 Google AI 生成。生成式 AI 尚处于实验阶段
今天,我们在最新模型中推出 智能体视频理解:Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。这项新能力可提升准确率,同时大幅降低视频分析的 token 用量和成本。与将代码执行和 Gemini 模型原生图像理解相结合的 智能体视觉 类似,智能体视频理解使用 Gemini 的原生视频工具来提升性能,并解锁视频处理的新能力,例如亚秒级时刻检索、更准确的异常检测、精确计数等。
该功能即日起可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API,用于上传的视频和 YouTube 视频。
基准测试
与当前的“静态”处理不同——模型以固定的每秒帧率摄取视频(默认 1 FPS,可通过 API 调整)——智能体式视频理解将模型的核心推理与原生视频工具相结合,从而在视觉帧、音频和文字稿中动态搜索、扫描并检查目标视频片段。在各项标准视频分析基准测试中,具备智能体式视频理解能力的 Gemini 模型可将分析成本降低高达 66%,将 token 消耗降低高达 88%,同时将准确率提升高达 7%。
这些效率提升在长视频上尤为显著(从 10 分钟的操作指南,到 90 分钟的讲座,再到数小时的录像),而静态处理迫使开发者在高 token 成本与会丢失关键细节的技术之间做出选择。
启用智能体式视频理解后,搭配 Gemini 3.7 Flash,token 消耗可降低高达 88%,准确率可提升高达 7%。
尽管这些收益覆盖全部三款受支持的模型,但具备智能体式理解能力的 Gemini 3.7 Flash 提供了整体最佳质量,以及质量与成本效率的最佳组合,使其在受测视频理解模型中处于准确率—成本帕累托前沿。
使用智能体式视频理解,使 Gemini 3.7 Flash 处于视频分析的准确率—成本帕累托前沿。
工作原理
智能体式视频理解并非以固定帧率摄取媒体流的静态处理,而是让 Gemini 主动、以目标为导向地决定看什么、以何种速度观看,以及通过哪种模态(帧、音频或文字稿),只获取所需的时刻与信号。开发者此前可以手动完成这些操作;有了智能体式视频理解,Gemini 可以通过智能体循环来完成,调用内部工具加载视频文件的相关部分,从而显著降低开发开销。
能力与用例
智能体式视频理解改变了开发者在各类高要求应用中处理长视频内容的方式。
- 亚秒级时刻检索:精确定位在 1 FPS 下容易错过的转瞬状态变化和紧凑剪辑边界,使精确的自动化视频剪辑成为可能。
- 长视频大海捞针式搜索:在长达数小时的视频中回答复杂查询,而无需消耗数百万 token。
- 异常检测:以更高的 FPS 对感兴趣的时间窗口重新采样,以检查快速运动和细微的视觉伪影。
- 动作与物体计数:随时间准确追踪重复的身体动作和不同的物体。
真实世界的结果
我们的许多抢先体验合作伙伴在测试智能体视频理解时看到了强劲的表现。以下是他们的评价:
开始使用
智能体视频理解已可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 中使用,并在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出。它采用标准的 Gemini API token 定价,不收取额外功能费用。
要启用该功能,只需在 API 配置中将 processing 设置为 "agentic"。阅读我们的 开发者指南,以更深入地了解该功能以及如何开始使用。
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)我们还将把智能体视频理解在效率和质量方面的提升带给 Google 各产品的数十亿用户。该功能很快将在 Gemini 应用中向所有用户推出,覆盖 Flash 和 Flash-Lite 模型。未来几个月,智能体视频理解还将为 YouTube 视频观看页上的‘Ask YouTube’功能提供支持,借助 Gemini 提供基于画面的更高质量回答。
致谢他们对本工作的贡献: Sergi Caelles、Filip Pavetić、Ahmet Iscen、Suhas Yogin 以及 Agentic Vision 团队。
在收件箱中获取 Google 的最新资讯
订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠及更多内容。
您的信息将按照 Google 的隐私政策。加以使用。您可以随时选择退出。
来源:Google DeepMind · deepmind.google