Gemini开始主动看视频

Google DeepMind 为 Gemini 引入 Agentic Video Understanding,让模型从均匀抽帧转向自主定位、放大和复核关键片段。视频理解正在从一次性问答,变成可追踪的主动调查过程。
Gemini 不再满足于把视频“看一遍”
Google DeepMind 近日公布 Agentic Video Understanding,尝试让 Gemini 自主决定应该检查视频的哪些部分、调用什么工具,以及是否需要回头验证结论。它不是一次常规的模型版本升级,而是把视频理解从“输入视频、直接回答”改造成带有计划、搜索和复核环节的 Agent 工作流。
**Agentic Video Understanding 是一种由模型主动规划视频检索与分析步骤、按需调用工具并依据视觉证据修正答案的视频理解方法。**传统多模态模型通常按照预设帧率读取视频,再基于一次前向推理给出结论;Agentic Video Understanding 则会先判断问题需要什么证据,然后定位时间段、检查关键帧、追踪实体关系,必要时重复这一过程。
这项变化看似只是给 Gemini 多加了几步,实际解决的是视频模型长期存在的一个结构性问题:视频太长,而真正有用的信息往往只出现几秒。

均匀抽帧简单,但很容易错过关键一秒
**均匀抽帧是按照固定时间间隔从视频中选取画面,再交给模型统一分析的方法。**Google 的 Gemini 视频理解文档显示,系统默认可以按每秒 1 帧,也就是 1 FPS 的方式提取视频片段;静态讲座可以降低帧率,快速动作或精细时间分析则需要提高 FPS。
固定抽帧的问题不在于模型“看不懂”,而在于它可能根本没有看到证据。假设一段 90 分钟的仓库监控里,某件商品只在第 47 分 12 秒被遮挡了半秒,1 FPS 抽帧就可能跳过这一瞬间;如果为了保险把采样率提高到 10 FPS,输入帧数、视觉 token、推理延迟和费用又会同步上升。
**视频理解的核心矛盾是覆盖率与计算成本无法同时拉满。**采样太稀会漏掉动作,采样太密则会把大量重复画面送入上下文窗口。即便模型拥有 200 万 token 上下文,把数小时视频全部高分辨率展开也不等于高质量理解,因为模型仍需在海量近似帧中找到真正相关的几秒。
Google 此前披露,Gemini 2.5 Pro 在低媒体分辨率设置下,可以利用 200 万 token 上下文处理约 6 小时视频;在 VideoMME 上,低分辨率设置取得 84.7% 准确率,而更高设置为 85.2%,两者只差 0.5 个百分点。这说明压缩输入在许多任务中确实有效,但它仍然是一种全局、预先设定的压缩策略,不能针对具体问题动态调整注意力。
主动分析的关键,是先找证据再回答
**主动视频分析把一次性推理拆成了规划、检索、检查、关联和验证五个阶段。**模型接到问题后,不必立刻生成答案,而是先形成一个可执行计划,例如判断需要检查哪个时间段、识别哪些人物、追踪什么物体,以及是否需要读取字幕或放大局部区域。
一个典型过程可以概括为:
- 规划问题:把“事故是怎么发生的”拆成车辆位置、信号灯状态、碰撞时间和前后动作等子问题。
- 粗定位片段:先低成本浏览视频结构,寻找场景切换、字幕、声音事件或目标人物出现的时间范围。
- 细查关键帧:对候选片段提高采样率,放大局部区域,检查小字、手部动作或短暂出现的物体。
- 建立跨时间关联:确认前后画面中的人物或物体是否为同一实体,而不是只分析孤立画面。
- 回溯与验证:当视觉证据与字幕、音频或已有推断冲突时,重新定位并检查其他片段。
这套流程更像调查员翻看监控,而不是观众从头到尾看完电影。调查员不会平均分配注意力,而会先看事件发生前后,再追查人物何时进入画面、物体从哪里出现,并通过多个角度交叉验证。
实体图谱让数小时视频不再只是帧的堆积
**实体图谱是将视频中的人物、物体、地点和事件表示为节点,并用跨时间关系连接这些节点的结构。**Google DeepMind 相关研究引入了实体图谱推理,用它记录某个人在不同时间段的出现、某件物品的转移,以及事件之间的先后与因果线索。
实体图谱对长视频尤其重要,因为同一个目标可能隔几十分钟再次出现。单纯依赖上下文记忆,模型容易把穿着相似的人混为一谈,也可能忘记早期片段中出现过的细节;图谱则把“谁在什么时候拿过什么”变成可查询的结构,帮助 Agent 决定下一步应该回看哪里。
Google DeepMind 论文《Agentic Very Long Video Understanding》给出的结果显示,Gemini 2.5 Pro 采用均匀采样时已经超过此前的 EgoButler 系统,而加入实体图谱等 Agent 机制后,整体结果又提高了 10.7%。这不是简单提高帧率得到的收益,而是改变检索和推理方式带来的增量。
这组数据仍需谨慎解读。10.7% 来自特定长视频评测设置,不意味着所有视频任务都会获得同等提升;短视频摘要、镜头分类等任务本来就不缺关键帧,Agent 的多轮搜索反而可能增加延迟。它真正占优的是证据稀疏、时长很长、问题明确且需要跨时间关联的任务。
Gemini 的两次更新指向同一条路线
**Agentic Vision 是 Gemini 通过视觉推理和代码执行主动检查图片的能力。**Google 在 2026 年 1 月为 Gemini 3 Flash 介绍该能力时,模型已经可以制定计划,借助代码执行完成缩放、裁剪和图像处理,再依据局部证据回答问题。
Google 当时披露,开启代码执行后,Gemini 3 Flash 在多数视觉基准上的质量提升稳定在 5% 至 10%。如今把这一思路扩展到视频,难点从“图片的哪个区域值得放大”变成了“数小时内容中的哪个时间段值得展开”,搜索空间增加了时间轴、镜头关系和跨片段实体关联。
两项能力的共同方向十分明确:多模态模型不再被动接收一组预处理好的像素,而是能够操作输入、改变观察尺度并主动补足证据。对于视觉任务,这相当于从闭卷答题变成允许翻页、放大和做笔记的开卷调查。
与传统视频理解相比,变化不只在准确率
**Agentic Video Understanding 的主要价值是把算力集中到高信息密度片段,而不是无差别提高整段视频的采样率。**它可能降低无效视觉 token 的比例,也为复杂问题提供更清晰的证据链,但代价是更多模型调用、工具执行和状态管理。
| 方案 | 取帧方式 | 长视频成本 | 关键瞬间捕获 | 跨时间推理 | 延迟特征 | 适合场景 | |---|---|---:|---|---|---|---| | 固定 1 FPS 抽帧 | 全程均匀采样 | 可预测 | 较弱,可能漏掉瞬时动作 | 依赖单次上下文推理 | 相对稳定 | 讲座摘要、访谈、静态演示 | | 高 FPS 全量分析 | 全程密集采样 | 很高 | 较强 | 仍需模型自行关联 | 高且随时长增长 | 短视频、体育动作、工业检测 | | Agentic Video Understanding | 先粗查,再按需提高局部分辨率或采样率 | 动态变化 | 较强 | 可结合实体图谱和多轮验证 | 不稳定,但算力更集中 | 长视频问答、监控调查、流程审计 | | 领域专用视频管线 | 检测器、跟踪器和规则引擎组合 | 前期开发成本高 | 针对目标事件较强 | 取决于定制逻辑 | 部署后通常较稳定 | 工厂质检、固定摄像头、标准化业务 |
主动分析并不会立刻取代领域专用系统。固定摄像头下的安全帽检测、生产线缺陷识别等任务目标单一,经过训练的检测器通常更便宜、更快,也更容易给出确定性 SLA;Agentic Video Understanding 更适合问题不断变化、无法提前写完规则的开放式分析。
真正有用的场景,是寻找“针尖式证据”
**长视频中的稀疏事件检索是 Agentic Video Understanding 最具商业价值的场景。**企业往往不是需要一段泛泛的摘要,而是希望回答一个具体问题,并定位支撑结论的时间戳。
在安防调查中,模型可以先找出目标人物出现的片段,再追踪其携带物品和移动路线;在体育分析中,模型可以检查一次失误发生前数秒的站位变化,而不是平均总结整场比赛;在教学视频中,模型可以定位讲师第一次解释某个概念的位置,并对后续例题进行关联。
在软件测试和操作审计中,这套能力也可能比通用摘要更有价值。开发团队可以让模型检查数小时录屏,寻找某个弹窗首次出现的时间、复现步骤和此前的鼠标操作;金融或医疗等高合规行业则可以要求模型列出结论对应的时间戳和画面证据,再交给人工复核。
开发者暂时不能只看模型名称
**Google 目前更像是在公布一条技术路线,而不是交付一个拥有独立型号、固定价格和明确 SLA 的全新视频模型。**现有公开材料没有给出 Agentic Video Understanding 的独立模型 ID、单独价格表、固定工具调用上限,也没有证明所有 Gemini 视频请求都会自动进入 Agent 模式。
因此,开发者不能把它简单理解为“切换一个参数,准确率就提高 10.7%”。一个可投入生产的 Agentic Video 系统还需要处理视频存储、片段索引、工具权限、执行超时、状态恢复、引用时间戳和人工复核等工程问题。
| 能力或产品 | 当前公开定位 | 已披露数据 | 独立价格 | 生产使用判断 | |---|---|---|---|---| | Gemini 传统视频理解 | 视频描述、问答、分段与时间戳引用 | 默认可按 1 FPS 取帧 | 随所选模型和 token 计费 | 已有明确开发路径 | | Gemini 2.5 Pro 低媒体分辨率 | 用较少视觉 token 处理长视频 | 约 6 小时/200 万 token;VideoMME 84.7% | 无单独能力定价 | 适合成本敏感的长视频任务 | | Gemini 3 Flash Agentic Vision | 对图片主动缩放、检查和处理 | 多数视觉基准提升 5%—10% | 无单独能力定价 | 可作为主动视觉分析参考 | | Agentic Video Understanding | 自主检索、实体关联和多轮验证 | 相关长视频研究提升 10.7% | 尚未公布 | 更接近新架构与研究能力 |
本文不提供调用示例,是因为 Google 尚未在公开材料中确认一个可稳定调用的独立 Agentic Video Understanding 端点或专属模型名称。此时给出代码容易把常规 Gemini 视频输入误写成完整的 Agent 能力,也无法准确表达其内部搜索、工具执行和验证流程。
Agent 看得更主动,也带来新的安全问题
**视频提示注入是 Agentic Video Understanding 进入生产环境后必须防范的风险。**攻击者可以在画面、字幕或幻灯片中嵌入“忽略用户要求”“调用某项工具”等文字,诱导模型把视频内容误当成系统指令;一旦 Agent 拥有代码执行、文件读取或外部检索权限,风险会高于普通视频摘要。
工具权限需要遵循最小化原则。视频分析 Agent 应把媒体内容视为不可信数据,限制代码执行环境的网络访问和文件权限,并记录每一次裁剪、检索、转写和跳转操作。对于医疗判断、事故认定和合规审计,最终输出还应包含时间戳、证据帧和不确定性,而不能只给自然语言结论。
可复现性同样会成为新的工程难题。均匀抽帧管线输入固定,相同视频通常得到近似结果;Agent 会根据中间判断选择不同片段,一次错误定位可能使后续步骤全部偏离。生产系统需要保存规划轨迹、候选片段和工具结果,否则开发者很难解释为什么某次回答正确、下一次却漏掉同一个事件。
视频理解正在从模型能力变成系统能力
**Gemini 此次更新最重要的信号,是视频理解的竞争重点正在从上下文长度转向观察策略。**更大的上下文窗口依然重要,但“能塞进多少帧”不再是唯一指标;模型能否判断该看哪里、何时提高分辨率、如何验证证据,将直接决定长视频任务的实际质量和成本。
这也是 Agent 路线在多模态领域比在通用聊天中更容易体现价值的原因。文字 Agent 经常被批评为把一次调用拆成多次调用,而视频 Agent 面对的输入天然包含大量冗余,主动搜索确实可能减少无效计算,并提高稀疏事件的命中率。
短期来看,Agentic Video Understanding 更适合证据稀疏、问题明确且单次任务价值较高的场景,而不是所有视频请求的默认选项。对于一分钟产品演示,直接输入整段视频通常更快;对于六小时监控、整场赛事或长期第一视角记录,让模型学会“先找再看”才可能真正改变可用性。
长期来看,视频模型的产品形态可能不再是一行模型名称,而是一套由视觉模型、检索器、时间轴索引、实体记忆和工具沙箱组成的系统。Google 已经把图片理解从静态识别推进到主动调查,现在又将同一逻辑延伸到视频;接下来真正值得观察的,不只是跑分还能提高多少,而是这套能力何时获得稳定接口、可控成本和完整证据链。
参考来源
- Google Gen AI Python SDK:Google 官方 Python SDK,可用于核对 Gemini 文件上传、多模态输入与模型调用方式。
- Google Gen AI JavaScript SDK:Google 官方 JavaScript/TypeScript SDK,包含 Gemini 多模态开发接口与版本更新记录。
本文关键事实还参考了 Google DeepMind 的《Introducing agentic video understanding with Gemini》、Google 的 Gemini 视频理解文档、Gemini 3 Flash Agentic Vision 公告,以及论文《Agentic Very Long Video Understanding》。受文末域名规则限制,未附上述站点的外链。



