AIHub

Gemini Agentic Video Understanding 上手实战:一个参数让长视频分析省 88% Token,YouTube 链接直接喂

进阶约 13 分钟读完2026-09-06#Gemini#视频理解#Google AI#多模态#API 教程
Gemini Agentic Video Understanding 上手实战:一个参数让长视频分析省 88% Token,YouTube 链接直接喂

2026 年 9 月 2 日,Google DeepMind 在官方博客宣布上线 Agentic Video Understanding(智能体视频理解),覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 三个模型,通过 Gemini API(Google AI Studio)和 Gemini Enterprise Agent Platform 开放,视频文件和 YouTube 链接都支持。

它解决的是一个老痛点:传统视频理解是"静态处理"——按固定帧率(默认 1 FPS)把整段视频切帧喂给模型。一段 90 分钟的讲座这么喂下来就是 5400 帧,Token 账单感人;想省钱就得降帧率,代价是关键瞬间被漏掉。Agentic 模式下,模型自己决定看哪一段、用多高的帧率、走画面/音频还是字幕轨道,只取回答这个问题真正需要的片段。官方数据:Token 消耗最多降 88%,分析成本最多降 66%,准确率反而提升最多 7%——视频越长,收益越明显。

这篇文章把它跑通:开启方式、两种输入源、典型场景写法,以及它的边界在哪里。

一、核心思路:从"硬吞"变成"按需取看"

理解这个特性最好的方式是类比 RAG:静态处理相当于把整本书塞进上下文,Agentic Video Understanding 相当于先翻目录、再精读相关章节。

模型内部跑一个智能体循环:收到问题后,先用低成本方式扫一遍视频(抽稀帧 + 字幕/音频轨),定位候选时间段,再对目标片段动态提高采样率细看,需要时反复回看。这带来四个此前很难做好的能力:

  • 亚秒级时刻检索:1 FPS 固定采样必然错过瞬间状态变化和紧凑剪辑点,动态采样能精确定位到秒以内,自动剪辑、高光提取因此可行;
  • 长视频大海捞针:在数小时的录像里回答复杂问题,而不用烧掉几百万 Token;
  • 异常检测:对"看起来有意思"的时间窗重新用高帧率采样,捕捉快速运动和细微画面异常;
  • 动作与物体计数:跨时间准确跟踪重复的物理动作(比如一段健身视频里做了几个深蹲)。

对开发者来说最省心的一点是:这套"手动切片、分段上传、结果拼接"的流水线以前要自己写,现在模型内部完成了,你只传一个完整视频和一个问题。

二、开启方式:一个参数的事

准备工作只有一个:在 Google AI Studio 创建 API Key,装好官方 SDK(pip install google-genai)。官方给出的最小示例是把输入的 processing 字段设为 "agentic":

from google import genai

client = genai.Client()  # 读取环境变量 GEMINI_API_KEY

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic",   # 关键开关,就这一行
        },
        {
            "type": "text",
            "text": "这场发布会最重要的 3 个发布是什么?分别出现在什么时间点附近?",
        },
    ],
)

print(interaction.output_text)

注意三点:

  1. 模型要选对:gemini-3.7-flash、gemini-3.6-flash、gemini-3.5-flash-lite 三个支持,其中 3.7 Flash 质量最好,官方称其在准确率-成本帕累托前沿上;其他模型传了 agentic 也不会生效。
  2. 不额外收费:走的还是标准 Token 计价,没有功能附加费——省下来的 88% Token 就是实打实的账单下降。
  3. 不改参数就是老行为:不写 processing 或写成静态模式,行为与之前完全一致,存量代码零影响,可以按场景灰度切换。

三、两种输入源:YouTube 链接与本地文件

YouTube 链接是最省事的路径——不下载、不转码、不占你的上传带宽,把 URL 直接放进 uri 即可(如上面的示例)。适合分析公开视频:竞品发布会、行业讲座、教程录像。典型查询写法:

# 长视频大海捞针:让模型自己去找片段
{"type": "text", "text": "主讲人在哪一段演示了实时协作功能?给出起止时间和演示要点。"}

# 计数类任务:动态帧率的主场
{"type": "text", "text": "这段训练视频里,运动员一共完成了多少次完整的折返跑?"}

本地/私有视频则先上传到 Gemini 的文件存储再引用。私有素材(内部会议录像、监控片段、未公开的成片)只能走这条路:

video_file = client.files.upload(file="internal-review-90min.mp4")

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {"type": "video", "uri": video_file.uri, "processing": "agentic"},
        {"type": "text", "text": "找出所有画面出现红屏或花屏的时间点,并描述持续时长。"},
    ],
)

一个实用建议:问题越具体,省钱效果越好。"总结这个视频"会迫使模型看更多内容;而"第 2 个演示环节里用户点击了哪些按钮"这类带目标的问题,才能让智能体循环发挥跳读优势。

四、成本账怎么算

官方给的是相对值(Token -88%、成本 -66%),换成直觉理解:一段以前静态处理要花 10 块钱的长视频,同样问题走 agentic 大约 3-4 块钱,答案还更准。三个落地建议:

  • 长视频优先切:10 分钟以上的素材收益最大,30 秒的短视频本来就没几帧,切换意义不大;
  • Flash-Lite 打底、3.7 Flash 兜底:批量跑监控/审核类任务用 gemini-3.5-flash-lite 成本最低,精度不够的疑难样本再升级 3.7 Flash 重试;
  • 日志里盯 Token 用量:agentic 的消耗是动态的,同一视频不同问题差异巨大,上线前用自己的典型素材跑一轮基准,别拿官方百分比直接做预算。

另外谷歌确认该能力会进入 Gemini 应用(Flash/Flash-Lite 模型),并在未来几个月支撑 YouTube 播放页的 "Ask YouTube" 功能——也就是说 C 端用户很快会习惯"直接问视频",B 端产品提前接好这个能力是有先发价值的。

五、注意事项与常见问题

  • 视频越长越赚,但也别迷信上限:数小时的素材仍建议按章节拆分提问,单次塞多小时视频 + 大而全的问题,效果和成本都会退化;
  • YouTube 链接只对公开视频有效:私享/会员专享/地区限制的视频拉取会失败,这类素材老老实实本地上传;
  • 别拿它当实时流处理:这是离线分析能力,摄像头实时流、直播场景不适用;
  • 隐私合规:内部录像上传到第三方 API 前过一遍公司数据政策,敏感片段考虑先本地打码;
  • 结果里的时间点要抽查:亚秒级定位能力很强,但涉及合规审核、版权剪辑这类"错一个时间点就出事"的场景,保留人工抽检环节。

小结

Agentic Video Understanding 的本质,是把"看视频"从无脑全量采样变成了有目标的检索式精读——一个 processing: "agentic" 参数,换来最高 88% 的 Token 节省和 7% 的准确率提升,还不加价。如果你手上有发布会纪要、教程索引、监控抽检、体育/健身动作分析这类长视频场景,今天就可以用 AI Studio 免费额度跑通最小示例,再决定要不要替换掉现有的静态处理管线。

相关教程

Gemini Agentic Video Understanding 上手实战:一个参数让长视频分析省 88% Token,YouTube 链接直接喂 | AIHub