求问一个实时直播翻译的服务/软件

应该是佬说的这样。Gemini那个我还没找到其他的开箱即用的项目不知道怎么样

OpenAI 和 Gemini 都有直接转录的模型,效果其实都不错。中文的话,其实豆包的也还可以。这些转录模型都是基于 LLM 的。当然转录的结果甚至可以让便宜的模型再做一轮优化,因为大部分转录模型大概窗口只有 30 秒。如果需要更长的上下文的话,可以用便宜的模型额外优化一轮。

我用过一个项目是接了千问的,好像语音识别也是发过去的,且支持上下文,但是还是感觉准确度一般般。

日语转录模型我记得fish的转录模型识别率就挺好的

搞不好其实直接接了OAI或者GEMINI的服务,汉化组团队有时候因为人多所以比较舍得选成本更高的东西

找到了时间点,用我的 Soniox + LLM 试了一下,感觉还行

我这里 LLM 还没上上下文和术语表,所以有的地方有点问题,但是转录的精确性没问题

而且用的是 4.1 nano 翻译有点区,改成 3.8 flash wo/thinking 应该会好点

3.8flash lite

加上术语表的情况

佬友试试Mistral,专门做翻译模型的,前段时间我让AI做了一下对比,感觉算是专业做翻译的


fish-audio/transcribe-1这个模型试了下,日语准确率非常高,再加上3.8f,比直播的这个质量还要好

会不会是音画延时 将耗时的转录和翻译做完 再一起推流 这样看起来就是既实时又能出好的效果了