关于长视频大模型记忆

刚才看到鸭老师发的要做ai电影突然想起来之前搞得一个横向,公安联合破案中长视频分析模块。我没怎么做过关于ai视频生成的研究,但是对于长视频识别模型这一部分倒是看过一点论文。尝试复现了几个发现效果都比较一般,有佬清楚当前这一问题当前是怎么解决的吗?过长的视频模型怎么保存分片前后的记忆的呢?
有段时间没了解相关内容了,不知现在是不是有了一些新的见解与方法。 :smiley:

等即梦3.0出来说是可以生成10分钟的内容,目前还是需要牛逼的后期介入的,一段一段生成

鸭老师,在哪里用积分换取你的 3 级教程?以前的几个帖子 cdk 兑换不了了 :tieba_087:

退出重新登录好像就行了啊,不行的就是过时了,比如sora那个

之前有用gemini反推视频内容,分镜啥的,确实是长了就不行。5分钟左右效果就还算很不错

所以说后续生成的内容其实每一段都和之前的会有一些偏差,超出上下文之后丢失的部分记忆还是需要后期来对生成的内容进行微调是吗。

现在的模型对长视频分析能力还是太有限了,我看到的差不多也是把两三个小时的电影拆成15min左右的片段,然后交给llm去总结,几乎都是抽关键帧来处理。时间短按这个逻辑应该挺合理的,但长视频目前看来效果一般。