現在用deepseek 或者 用不完的codex 能不能給2小時的日本電影加中文字幕了啊

codex 用不完,能讓codex 幹嗎? 視頻下載下來,

視頻本身沒有字幕。
幹的話要多久啊

这个思路很简单。本地有大量 ASR 模型可以用于识别。电脑性能还凑合的话,甚至可以用 Whisper Large /Turbo实时识别。
然后再把识别出来的字幕交给这些模型进行翻译。具体怎么做,要看你的要求。如果把 ASR 语音识别交给云端,Codex 这些模型也在云端的话,就可以做成实时的。

因为现在很多 ASR 语音识别服务都支持 Stream,也就是实时识别。

具体看你的要求高还是低。要求高的话,就用 Stream 实时语音识别,再实时翻译,可以用 WebSocket。要求低的话,就把整段语音发给模型,拿到完整的语音识别结果后,再交给 Codex 这些模型翻译并展示给你。我感觉这个用 Vibe Coding 做,大概两天就能完成。

其实你这个要求,GitHub 上已经有大量开源项目了。包括咱们平时用的 PotPlayer,也有现成的功能:ASR 语音识别加上大语言模型翻译。甚至不需要用大语言模型翻译,直接用传统的翻译方式就可以,谷歌翻译都行。

GitHub 上还有不少类似的项目。比如,很多人会找 B 站视频的大语言模型翻译结果,再总结视频内容。对于没有字幕的视频,可以先进行语音识别并生成字幕,再让大语言模型总结视频内容。这种需求其实挺常见的。

我估计AI不会使用一帧一帧给你看的这个笨方法来解决这个问题的.翻译完毕,大概也烧不了多少额度。