为什么 AI 处理一段 90 分钟的视频依然这么费劲?
你大概经历过这种情况:把一场一小时的线上分享会或培训录像交给 AI,拿回来的摘要恰好漏掉了你最在意的那一段。问题不在提示词。在本月之前,Gemini 看视频的方式和监控摄像头一样:每秒抽一帧,从头到尾,不管问题是否需要。Google DeepMind 于 2026 年 9 月 1 日发布的 Agentic 视频理解(agentic video understanding)改变了这一点:模型自己决定看哪一段、以什么速度看、通过哪种信号看。
Agentic 视频理解是 Gemini 的一种视频处理模式。模型把视频当作可检索的文件而不是固定的流:先读字幕稿定位相关时间段,再只加载这一段的画面或音频,遇到需要细节的问题时以更高帧率重看。
旧方式叫静态处理(static processing)。按 Google 的 token 文档,静态模式在低分辨率下每秒视频约消耗 100 个 token,高分辨率约 300 个。一段一小时的讲座,在你提出第一个问题之前,已经花掉约 108 万 token。Google 的发布文章给出同一段讲座在 Agentic 模式下的参考值约为 10.8 万 token,具体取决于提示。
对需要盯竞品发布会的市场人员、要核对录播课的教育工作者,或者要从两小时全员会议里抽出决策项的运营经理来说,这是「用一次就放弃」和「每周都用」之间的差距。
Google 在 2026 年 9 月 1 日到底发布了什么?
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 Agentic 视频理解,通过 Google AI Studio 和 Gemini Enterprise Agent Platform 的 Gemini API 提供。Google 表示在标准视频基准测试中,token 用量最多减少 88%,分析成本最多降低 66%,准确率最多提升 7%。支持上传文件和公开 YouTube 链接,按标准 token 计价,没有额外功能费。
发布文章由 Google DeepMind 的 Rohan Doshi 和 Mario Lučić 署名。对非工程师的实践者来说,有三点值得留意。
---这是一种模式,不是新模型。你继续用熟悉的 Flash 系列,只把视频处理方式从静态切换到 Agentic。
---功能已经在 Google AI Studio 上线,那是一个免费的浏览器界面,不只是裸 API。Google 表示 Gemini 应用内的 Flash 和 Flash-Lite 模型「很快」会跟上,同一引擎之后也会用在 YouTube 的 Ask YouTube 功能上。
---效率数字是 Google 自家基准的最大值。MLQ News 在 9 月 4 日报道,Google 开发者文档现在也把 Gemini 3.8 Flash 列为支持模型,所以支持列表已经比发布当天更长。
Google 强调四种能力:亚秒级时刻检索、跨多小时录像的「大海捞针」搜索、以更高帧率重看短时间窗口的异常检测,以及重复动作或物体计数。注意这四项全都是「针对视频某一部分」的问题,而不是「把整段视频总结一遍」的要求。
Agentic 视频理解的工作原理是什么?
静态处理以固定速率把视频的每一秒送进模型上下文,长视频在任何推理开始前就已经很贵。Agentic 处理加入一个导航循环:Gemini 先扫字幕稿,选定时间范围,只请求这一段的画面或音频,检查证据是否充分,不够就再来一轮。进入上下文的画面变少,成本随之下降,精度反而上升。
可以这样理解:读一份 300 页的报告,一种做法是逐页读完,另一种是先查目录。静态模式逐页读;Agentic 模式查完目录直接跳到第 142 页,细读前后几段,答案不完整就再回到目录。
Google 文档把 Agentic 模式的 token 分成三类:导航推理、按需加载片段的工具调用 token,以及最终输出。这就是为什么账单取决于你的问题。针对某一刻的窄问题只加载极少内容;要求逐段描述整段视频,模型就会走遍整条时间轴,节省幅度随之缩小。
Developers Digest 在 9 月 1 日的分析说得很准:这是一个「路由」层面的说法,不是「压缩」层面的说法。当你的问题只指向视频的一小部分,88% 是真的;它不是「看完整段视频」的折扣。
如何在 Google AI Studio 里不写代码就用上它?
打开 Google AI Studio,选择 Gemini 3.7 Flash,附加视频文件或粘贴公开 YouTube 链接,把视频处理设为 agentic(API 中的设置是 processing: "agentic")。然后提出带时间戳、讲者姓名或具体事件的针对性问题。免费账户可上传最大 2 GB 的文件,每天最多处理 8 小时 YouTube 视频。
多数人做错的一步是问题本身。Agentic 模式奖励具体,因为具体的指令告诉模型该去哪里看。以一段 75 分钟的产品分享会录像为例,对比下面两种提示。
弱提示:「总结这场分享会。」
强提示,可直接复制:
试试这个提示:
「你正在为市场团队复盘一段 75 分钟的产品线上分享会录像。请按顺序完成以下任务。(1)找出讲者提到价格、上线日期或具名集成合作方的每一个时刻,逐条给出时间戳和一句原话引用。(2)定位问答环节,列出每个观众问题和讲者回答,每条不超过 25 字。(3)找出在画面上停留时间最长的一张幻灯片,描述其内容。(4)标记所有无法从字幕稿核实、只能从画面推断的内容。以表格输出,列为:时间戳、类型、内容、可信度。」
这段提示的每条指令都给导航循环一个目标:一类陈述、一个环节、一项视觉特征。第(4)条是实践者最常跳过、却最不该跳过的,因为它迫使模型把「听到的」和「推断的」分开。
如果你已经按照我们的 ChatGPT 定时任务指南建立过重复性流程,同一原则在这里同样成立:先定义输出形态再运行,工具才会从一次性实验变成可复用的流程。
哪些视频任务最受益,哪些应该留在静态模式?
Agentic 模式在「长录像加针对性问题」上明显占优:在两小时会议里找出某一句话、统计演示失败了多少次、抽出每一个提到竞品的时间戳。静态模式在五分钟以内的短片、需要覆盖每一帧的任务,以及格式严谨比节省 token 更重要的输出上,仍是更好的选择。
Google 自己的文档指出,Agentic 导航在五分钟以下的短片上可能增加首个 token 的等待时间,并建议对延迟敏感的短片和需要全帧覆盖的任务采用静态处理。
目前最有参考价值的外部证据,是 PaperEdits 于 9 月 3 日在 Google AI 开发者论坛发表的小型基准测试,该团队已披露商业关联。在六段合成的十分钟视频上,提示和评分标准预先冻结、不设重试,Agentic 模式找回 20 个短暂事件中的 18 个,静态模式为 15 个;剪辑决策 F1 得分为 0.68 对 0.55。但在该测试中,静态模式的 token 用量少 26.42%,成本低 23.01%,在宽泛时刻检索上得分略高,而六次 Agentic 输出中有一次没能满足要求的 JSON 格式。
把这组数据当作决策规则,而不是矛盾。短片加宽泛问题:留在静态。长片加窄问题:切到 Agentic。六段合成视频不足以下结论,但与 Google 自己对适用范围的说法一致。
算术上明显偏向 Agentic 模式的实际场景:
---内容营销人员扫描竞品 90 分钟主题演讲中每一次提到价格的位置。
---培训负责人在三小时录播课里找出跳过安全步骤的确切时刻。
---运营经理从两小时全员会议中抽出每一项决策和负责人,附时间戳便于跟进。
---社交媒体运营在长访谈里找出三个最适合剪成短视频的切点。
常见错误和硬性限制有哪些?
最浪费时间的五种失误:要求完整摘要却期待 88% 的节省;用三分钟短片测试然后断定模式很慢;超出一小时的默认上下文上限却没切换到低分辨率;不做核实就相信计数和画面描述;以及以为功能已经在消费者版 Gemini 应用里上线,而它目前仍是 AI Studio 和 API 功能。
以下数字值得记住,均来自 Google 视频理解文档(2026 年 9 月 4 日报道的版本):
---拥有一百万 token 上下文的模型,在默认媒体分辨率下可处理最长一小时的视频,低分辨率下可达三小时。
---文件上传上限:付费用户 20 GB,免费用户 2 GB。
---免费账户每天 YouTube 处理上限为 8 小时视频。
---Gemini 3.7 Flash 和 3.6 Flash 的标准定价为每百万输入 token 1.35 美元、每百万输出 token 6.75 美元,有效期至 2026 年 12 月 31 日;Gemini 3.5 Flash-Lite 为 0.54 美元和 4.50 美元。
还有两条较软的限制同样重要。第一,Google 的安全文档明确说明视频输出可能不准确或带有偏见,并建议人工审核,所以计数、引用和画面描述在对照时间戳核实之前都只是草稿。第二,这是一个多步骤的代理循环,继承了代理的可靠性特征:比单次处理多出更多可能出错的环节,偶尔会出现结构化输出失误,比如 PaperEdits 测试中的 JSON 失败。要求表格输出之后,记得自己过一遍。
模型支持列表也在变化。本文反映 9 月 1 日的发布名单,加上 9 月 4 日文档中可见的 3.8 Flash。在围绕特定模型名称搭建流程之前,请先查阅最新文档。
马上试试:用你手上已有的视频做一次 20 分钟测试
挑一段你一直想回顾的录像,最好超过 30 分钟。在 Google AI Studio 用同一条针对性提示跑两次,一次静态、一次 Agentic,然后比较三件事:回复中显示的 token 数量、每个答案是否带可核对的时间戳,以及五分钟抽查内你能核实多少条陈述。
最好的第一个测试对象是你已经看过的分享会录像,因为你知道正确答案。让它找出你记得的三个时刻的时间戳。如果 Agentic 模式用更少 token 找到了,你已经有了一个可用的流程。如果漏了一个,在提示里加上讲者姓名或画面线索再跑一次。这一个循环教给你的,比任何基准测试都多。
更深一层的启示,适用于今年每一项新 AI 功能:能力以一个设置的形式到来,价值却通过你提出的问题到来。精准的任务说明把 90 分钟视频变成两分钟答案,含糊的说明把它变成一份昂贵的摘要。懂AI,更懂你 UD相伴,AI不冷。
由 UD AI 团队审阅。
准备好让 AI 替你看完那些没人有时间看的录像?
复盘长视频正是 AI 员工可以接手的重复性工作。UD 团队手把手带你完成每一步,从选择合适的模型和提示,到搭建团队每周都能自行运转的流程。