不需要语音克隆,仅需要文字转语音,效果较好,重点是性价比高,花点小钱也没事
需求是将稿子转化为播客,但是由于文字量大,所以找不到什么好的开源模型(很多模型气口、停顿都很奇怪),望佬友推荐,大概播客时长为40-50分钟。
稿子内容为自己搞的一个信息源系统,打算在每天通勤或者健身的时候当播客来听。
同样蹲一个解决方案
我用的本地的indextts 2
有显卡的话,可以看Qwen/Qwen3-TTS-12Hz-1.7B-Base,或者lj1995/GPT-SoVITS,可以在hugging face上找到。
我也推荐看看楼上佬友说的qwen的tts模型。我之前用这个克隆过良子的声音,感觉还可以。
推荐佬看看minimax的tts,之前我也在找后来看站内一个每日播报佬的口播很不错,我自己复刻了日报男生的声音,用来做群总结的日报播报,很不错。。
豆包语音因该是最好的,但效果还是差强人意
qwen3TTS,0.6B和1.7B可选,MAC和Windows随便跑,我生成10min的音频大概3min,音色还支持克隆自己喜欢的音色来生成
网上的整合包还挺好用的。。。。。
码住学习一下,我一般就是用祁风tts转成微软晓晓自己听,一直都是这样,也没有什么好的办法,手机的话,有个旧版的讯飞有声,之前就是洗漱和通勤的时候把公众号内容分享给它然后进行播报,这样用很久了,感觉还是前ai时代的产物 ![]()
佬要不看下MultiTTS用微软离线晓晓音色配合阅读app呢,我是用这个长时间听小说的
佬,什么整合包?能讲具体点嘛,,
什么整合包?同样蹲一个解决方案…
小米的mimo用的好的话其实不错的,他有个导演模式