应用与产品

谷歌推出 Gemini 智能视频理解:Token 消耗最高降 88%,成本最高降 66%

谷歌在 Gemini 中推出“智能体式视频理解”能力,能让模型主动选择查看视频片段与模态,从而在基准测试中实现最高 88% 的 Token 降低、最高 66% 的成本降低和最高 7% 的准确率提升。该功能已通过 Gemini API 在 Google AI Studio 与企业平台提供,适用于长视频、亚秒级检索和快速动作检测,但实际效果依赖具体视频与任务,仍需第三方与真实场景验证。

谷歌推出 Gemini 智能视频理解:Token 消耗最高降 88%,成本最高降 66%

谷歌在 Gemini 中推出“智能体式视频理解”能力,能让模型主动选择查看视频片段与模态,从而在基准测试中实现最高 88% 的 Token 降低、最高 66% 的成本降低和最高 7% 的准确率提升。该功能已通过 Gemini API 在 Google AI Studio 与企业平台提供,适用于长视频、亚秒级检索和快速动作检测,但实际效果依赖具体视频与任务,仍需第三方与真实场景验证。

谷歌宣布,Gemini 开始提供“智能体式视频理解”(agentic video understanding)能力。该功能允许模型根据问题主动决定要查看视频的哪些片段、以何种速度查看,以及调用画面、音频还是文字转录信息,而不是按照固定帧率从头处理整段视频。

谷歌在 2026 年 9 月 1 日发布的公告中称,在其标准视频分析基准测试里,这套方法可将 Token 消耗最多降低 88%,分析成本最多降低 66%,准确率最多提高 7%。相关功能目前已通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 提供,支持视频上传和 YouTube 视频。

谷歌需要强调的是,这些数字是“最高”改善幅度,而不是所有视频、模型和请求都能达到的固定结果。测试结果来自谷歌公布的基准,尚未有独立第三方评测能够验证这些具体幅度。

从固定采样转向主动检索

传统的视频理解通常按照固定的每秒帧数处理视频。Google 的开发者文档显示,Gemini 通过 File API 处理视频时,默认按每秒一帧保存画面,并同时处理音频;在默认媒体分辨率下,每秒视频大约对应 300 个 Token,低分辨率下约为 100 个 Token。快速动作因此可能在采样间隔中被遗漏。

新的智能体式处理则把 Gemini 的推理能力与原生视频工具结合起来。模型可以先定位可能相关的时间段,再对目标片段进行扫描、重新采样或重看,只提取回答问题所需的信号。谷歌将其描述为一个由“搜索、检查和观察”组成的智能体循环,模型会主动调用内部工具加载相关视频片段。

这一变化的核心不是单纯提高采样率,而是让模型把计算资源集中在与问题相关的内容上。对于一段包含大量无关画面的长视频,系统不必把全部素材都转换成同等规模的输入。

长视频和快速动作是主要应用场景

谷歌列出的应用包括亚秒级时刻检索、长视频中的关键信息搜索、异常检测,以及动作和物体计数。

亚秒级检索可以帮助模型识别快速状态变化和紧密的剪辑边界,这些细节容易被每秒一帧的静态处理错过。异常检测则可以让模型对感兴趣的时间窗口使用更高帧率重新检查,以观察快速运动或细微的视觉变化。

在“干草堆里找针”式的搜索任务中,模型可以在数小时的视频里寻找与问题相关的内容,而不必把整段视频全部送入上下文。对于课程讲座、操作指南、会议录像和监控类素材,这种方式有望降低长视频分析的输入成本。

动作和物体计数则需要模型在不同时间点持续追踪目标。谷歌表示,智能体式视频理解能够根据任务需要重新观看视频,以更准确地统计重复动作和独立物体。

谷歌此前已经在 Gemini 2.5 的视频理解工作中展示过类似方向,包括根据音视频线索定位演讲中的特定片段,以及统计视频中某个动作出现的次数。开发者可以参考 Google Developers 关于 Gemini 2.5 视频理解的介绍,了解这一能力从固定视频分析向时间定位和多模态推理发展的过程。

Gemini 3.7 Flash 位于成本与准确率平衡点

此次功能覆盖 Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 三个模型。谷歌表示,三款模型都能从智能体式处理获得效率和质量改善,但在其测试中,Gemini 3.7 Flash 同时提供最高的整体质量和较好的成本效率,位于准确率与成本的“帕累托前沿”。

这与谷歌近期强调低延迟、低成本智能体的产品路线一致。AIFlux此前曾报道 Gemini 3.6 Flash 与 3.5 Flash-Lite 的发布,其重点同样包括更高的 Token 效率和更少的冗余推理步骤。

不过,“帕累托前沿”是谷歌基于所选测试设置作出的产品定位,并不意味着 Gemini 3.7 Flash 在所有视频类型、任务或成本条件下都优于其他模型。实际效果仍会受到视频时长、画面复杂度、音频质量、问题设计和所需精度影响。

开发者无需为每次检索手动编排

在此前的开发模式下,团队可以自行截取视频、调整帧率、检查转录内容,再把相关片段交给模型分析。但这要求开发者为不同任务编写额外的检索和采样逻辑。

谷歌希望通过智能体式视频理解,把这些步骤交给 Gemini 自己完成。开发者只需在 API 配置中将视频处理方式设为 agentic,再提交视频和文字问题。谷歌给出的示例使用 Gemini 3.7 Flash 分析 YouTube 上的一场主题演讲,并要求模型找出其中最重要的三项公告。

谷歌称,该功能采用标准 Gemini API Token 定价,不收取额外的功能费用。对于希望复用视频、处理大文件或分析长视频的开发者,官方文档仍建议使用 Files API;文档也提醒,超过一定规模的请求、较长视频以及需要多次调用的素材,不适合直接以内联数据方式提交。具体的输入方式、模型限制和 Token 计算方法,可参阅 Gemini API 视频理解文档

从开发者工具走向 Gemini 和 YouTube

谷歌表示,智能体式视频理解未来将逐步进入 Gemini 应用,覆盖 Flash 和 Flash-Lite 模型。公司还计划在未来几个月把这项能力用于 YouTube 视频观看页面上的“Ask YouTube”功能,让用户针对视频内容提问时,答案更多地依据画面本身,而不只是音频转录或标题信息。

这条路线把视频理解从开发者接口延伸到面向普通用户的产品。它也与谷歌把视频工具从一次性生成推进到连续工作流的做法相互呼应。AIFlux此前在 Gemini Omni 1.1 Flash 的报道中提到,视频模型的竞争正在从生成几秒钟画面,转向对素材、镜头和生产流程的更强控制;此次更新则把重点放在对已有视频内容的检索和理解上。

如果这项能力按谷歌所说的方向落地,视频分析的瓶颈将不再只是模型能否“看懂”视频,还包括模型能否以较低成本找到真正相关的片段,并对快速变化保持足够准确的判断。

仍需观察真实场景中的稳定性

目前能够确认的是,智能体式视频理解已经在谷歌的三个 Gemini 模型中推出,并可通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform使用。谷歌也公布了成本、Token 和准确率的最高改善幅度,以及若干面向长视频和快速动作的应用方向。

但仍有几个问题没有在公告中得到充分回答:这些改善在不同类型视频上的分布如何,谷歌基准测试使用了哪些数据和提示词,模型为寻找答案进行了多少次工具调用,以及在误判相关片段时是否会抵消节省下来的 Token。对于企业用户而言,工具调用次数、延迟、可复现性和人工复核负担,可能与单次请求的 Token 成本同样重要。

因此,这次发布更适合被看作视频理解工作流的一次架构变化,而不是一个已经解决所有视频分析问题的通用方案。它让 Gemini 能够主动决定“看什么、怎么看”,但这种主动性最终能否转化为稳定的生产效率,仍需要更多公开测试和真实项目数据来检验。

来源: Google DeepMind:Introducing agentic video understanding with Gemini

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读