一个半小时之后直播
说实话,语音这块还真不怎么期待…
这个模型能打断用户了,不知道还有没有什么惊喜
好像还能选择推理能力?一边思考一边说?
我只关注Realtime Translate跟Realtime Transcription,看直播能做翻译/转录用 ![]()
这个应该更强,毕竟它可以自由打断用户了,但是可能非常非常贵吧
其实是完全不一样的方向,翻译/转录也不需要打断,
Openai也是把它们分成三个不同系列
OpenAI摊子摊这么大,真的能把饼摊的又大又好吗
感觉OpenAI同时在进行的方向比A÷多好多
我最期待的是 模型会主动像真人一样主动和我说话 而不是我说一句它说一句
不知道它这个能不能做到呢?我看它是可以打乱你说话,但如果你沉默的话,它好像也会沉默?
哎,OpenAI 真的太辛苦了![]()
画图模型要和 Google 比,语音模型要和豆包比,编程要和 Claude 比,订阅价格要和 Deepseek 比
我不希望模型我沉默 它也沉默 这不还是我说一句它说一句
所以whisper真的不更新了吗(
它这个应该可以向下兼容?当时, Realtime Transcribe 没发布的时候,我就用 Realtime 1.5 做 Transcribe![]()
等它发布之后可以试试,比如说让它过一会说一句话?不知道行不行,我猜应该还不行
话说豆包可以做到这个吗?
不知道呢,应该不更新了吧。可能以后就换成 Real time Transcribe 了?
新模型要是有活人感就好了,可以当一个不错的伙伴
别语音的时候稳稳接住我 ![]()
语音这块主要api计费黑洞 之前是只要产生了就算被用户打断一样要收费
比如说 讲过故事 在开始讲的时候和他说说不要说了 连续来个几下 api费用爆炸![]()
只有openai自己的产品能用得起了
没用过它的语音TTS有人用吗?不知道咋样
现在可以了!可以主动发消息了
还可以听呼吸声之类的声音,来决定是否发消息
只有pro/plus套餐才能用
我已经买了api了 用不起啊
