分享一下gemini的视频分析能力。

最近在帮一个老板搞ai视频一条龙。其中有一个步骤是分析大量只有10秒~30秒的视频片段,提炼出每个片段的标签(5~10个关键字)。用的谷歌全家桶。最开始老板给我的方案是用谷歌有个Video Intelligence API,可以提炼标签。后面发现gemini直接分析视频比这货省太多钱了。6000个视频估算Video Intelligence API要花500刀,gemini可能只要20刀。而且gemini还可以用提示词定制它输出哪些属性关键字。有一说一,我以前一直以为大模型只能识别图片,没想到视频也没问题。

7 个赞

谷歌的多模态能力本来就是最强的,而且它自家的notebookllm还能无缝衔接youtube视频分析,说实话现在用的越久越离不开谷歌,等以后pro到期可能真得氪金了

目前只有Google有视频分析能力,其他几家都没有
多模态做的太牛了,我之前也是用Google来做的视频提示词提取

试过短视频
效果很好
:sparkling_heart:

佬,你说的notebookllm是视频分析还是总结?分析视频后再模仿吗?

主要偏分析总结的,用来转文字之后进行总结的
都是给一个 youtube链接给他,会去读取里面的所有视频的文本内容

明白了,感谢佬。

好久没咋用google了这个是哪个模型哈

gemini 3.1 pro 嘛?

是 gemini 3.1 pro 嘛?

qwen3.5系列是支持原生视频多模态的,可以尝试下 ,我这边测效果还可以