谷歌为Gemini Flash上线智能体视频理解 最高削减88%视频Token

近日谷歌正式为旗下Gemini Flash系列大模型上线智能体(Agentic)视频理解能力,该技术通过动态筛选视频核心信息片段优化Token计算逻辑,可实现视频Token消耗量最高削减88%,对应视频理解推理成本最高下降66%,目前该功能已面向所有调用Gemini Flash API的开发者开放,将大幅降低长视频类AI应用的落地门槛。

配图

对于此前需要调用大模型处理长视频的开发者而言,Token成本高企一直是悬在头顶的难题:按照此前大模型普遍采用的全量帧编码逻辑,处理一段1小时的高清视频,仅Token消耗成本就超过3美元,且冗余信息还会干扰模型输出结果的准确性。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。