4T3Y8wi70ma tech.huanqiu.comarticle谷歌推出智能体视频理解功能,优化Gemini模型视频分析效能/e3pmh164r/e3pmtmdvg【环球网科技综合报道】9月3日消息,据biggo报道,谷歌近日宣布为Gemini 3.7 Flash、3.6 Flash以及3.5 Flash‑Lite模型新增智能体视频理解功能,在提升模型视频分析准确率的同时,显著降低视频分析的资源消耗与使用成本。该功能沿用Gemini API标准Token计费规则,不额外收取功能使用费。据介绍,以往模型处理视频多采用静态处理模式,按照固定帧率读取视频内容,默认帧率为1FPS,开发者可通过应用程序接口进行参数调整。全新的智能体视频理解功能,将模型核心推理能力与原生视频工具相结合,能够从视频视觉帧、音频、转录文本当中,动态检索、扫描、核验目标片段。 基准测试结果显示,搭载智能体视频理解能力的Gemini模型,最高可将视频分析成本降低66%,Token消耗量最高下降88%,分析准确率最高提升7%。该技术优势在长视频处理场景中表现突出。传统静态处理模式下,开发者往往需要在高额Token开销与遗失关键视频细节二者之间权衡取舍,新技术可有效摆脱这一困境。谷歌方面表示,Gemini 3.7 Flash搭配该新功能,综合表现最优,实现了分析质量与成本效率的良好平衡,处于视频理解任务准确率与成本的帕累托最优前沿。不同于固定帧率读取媒体流的静态处理方式,智能体视频理解赋予模型自主决策能力,可根据任务目标自主选择读取内容、播放速度,选取视频帧、音频、转录文本等信息模态,只提取任务所需片段与信号。以往需要开发者手动完成的筛选操作,如今可由模型通过智能循环调用内部工具完成,有效缩减开发工作量。该功能具备多项实用能力,支持亚秒级时刻检索,精准捕捉固定帧率下容易遗漏的状态变化与剪辑边界,助力高精度自动化视频编辑;可对时长数小时的长视频开展复杂内容检索,不用消耗海量Token资源;能够针对指定时间窗口调高采样帧率,完成快速运动画面、细微视觉异常的检测,还可以对时序下的重复动作、多类物体实现精准计数。目前,这项功能已经在Google AI Studio、Gemini企业智能体平台的Gemini应用程序接口上线,支持本地视频上传与YouTube视频解析,开发者只需在接口配置中将处理模式设置为“agentic”,即可开启该能力。按照谷歌规划,这项技术能力还将逐步向面向普通用户的产品落地。后续该功能将推送至Gemini应用全部Flash、Flash‑Lite模型用户;未来数月,智能体视频理解还将赋能YouTube视频页面的“Ask YouTube”功能,依托Gemini模型,输出更贴合视频画面内容的问答结果。(纯钧)1788400763098环球网版权作品,未经书面授权,严禁转载或镜像,违者将被追究法律责任。责编:林梦雪环球网178840076309811[]//img.huanqiucdn.cn/dp/api/files/imageDir/1a39299c1b8c0d0df7505864ad6fb711u1.png{"email":"linmengxue@huanqiu.com","name":"林梦雪"}
【环球网科技综合报道】9月3日消息,据biggo报道,谷歌近日宣布为Gemini 3.7 Flash、3.6 Flash以及3.5 Flash‑Lite模型新增智能体视频理解功能,在提升模型视频分析准确率的同时,显著降低视频分析的资源消耗与使用成本。该功能沿用Gemini API标准Token计费规则,不额外收取功能使用费。据介绍,以往模型处理视频多采用静态处理模式,按照固定帧率读取视频内容,默认帧率为1FPS,开发者可通过应用程序接口进行参数调整。全新的智能体视频理解功能,将模型核心推理能力与原生视频工具相结合,能够从视频视觉帧、音频、转录文本当中,动态检索、扫描、核验目标片段。 基准测试结果显示,搭载智能体视频理解能力的Gemini模型,最高可将视频分析成本降低66%,Token消耗量最高下降88%,分析准确率最高提升7%。该技术优势在长视频处理场景中表现突出。传统静态处理模式下,开发者往往需要在高额Token开销与遗失关键视频细节二者之间权衡取舍,新技术可有效摆脱这一困境。谷歌方面表示,Gemini 3.7 Flash搭配该新功能,综合表现最优,实现了分析质量与成本效率的良好平衡,处于视频理解任务准确率与成本的帕累托最优前沿。不同于固定帧率读取媒体流的静态处理方式,智能体视频理解赋予模型自主决策能力,可根据任务目标自主选择读取内容、播放速度,选取视频帧、音频、转录文本等信息模态,只提取任务所需片段与信号。以往需要开发者手动完成的筛选操作,如今可由模型通过智能循环调用内部工具完成,有效缩减开发工作量。该功能具备多项实用能力,支持亚秒级时刻检索,精准捕捉固定帧率下容易遗漏的状态变化与剪辑边界,助力高精度自动化视频编辑;可对时长数小时的长视频开展复杂内容检索,不用消耗海量Token资源;能够针对指定时间窗口调高采样帧率,完成快速运动画面、细微视觉异常的检测,还可以对时序下的重复动作、多类物体实现精准计数。目前,这项功能已经在Google AI Studio、Gemini企业智能体平台的Gemini应用程序接口上线,支持本地视频上传与YouTube视频解析,开发者只需在接口配置中将处理模式设置为“agentic”,即可开启该能力。按照谷歌规划,这项技术能力还将逐步向面向普通用户的产品落地。后续该功能将推送至Gemini应用全部Flash、Flash‑Lite模型用户;未来数月,智能体视频理解还将赋能YouTube视频页面的“Ask YouTube”功能,依托Gemini模型,输出更贴合视频画面内容的问答结果。(纯钧)