OpenAI 已发布 GPT-Live-1 (Bidi-1)

一个半小时之后直播

9 Likes

说实话,语音这块还真不怎么期待…

1 Like

这个模型能打断用户了,不知道还有没有什么惊喜

好像还能选择推理能力?一边思考一边说?

2 Likes

我只关注Realtime Translate跟Realtime Transcription,看直播能做翻译/转录用 :joy:

这个应该更强,毕竟它可以自由打断用户了,但是可能非常非常贵吧

其实是完全不一样的方向,翻译/转录也不需要打断,
Openai也是把它们分成三个不同系列

1 Like

OpenAI摊子摊这么大,真的能把饼摊的又大又好吗 :distorted_face: 感觉OpenAI同时在进行的方向比A÷多好多

2 Likes

我最期待的是 模型会主动像真人一样主动和我说话 而不是我说一句它说一句

不知道它这个能不能做到呢?我看它是可以打乱你说话,但如果你沉默的话,它好像也会沉默?

哎,OpenAI 真的太辛苦了:joy:
画图模型要和 Google 比,语音模型要和豆包比,编程要和 Claude 比,订阅价格要和 Deepseek 比

8 Likes

我不希望模型我沉默 它也沉默 这不还是我说一句它说一句

所以whisper真的不更新了吗(

它这个应该可以向下兼容?当时, Realtime Transcribe 没发布的时候,我就用 Realtime 1.5 做 Transcribe​:laughing:

等它发布之后可以试试,比如说让它过一会说一句话?不知道行不行,我猜应该还不行

话说豆包可以做到这个吗?

不知道呢,应该不更新了吧。可能以后就换成 Real time Transcribe 了?

新模型要是有活人感就好了,可以当一个不错的伙伴
别语音的时候稳稳接住我 :rofl:

1 Like

语音这块主要api计费黑洞 之前是只要产生了就算被用户打断一样要收费
比如说 讲过故事 在开始讲的时候和他说说不要说了 连续来个几下 api费用爆炸:joy:

只有openai自己的产品能用得起了

1 Like

没用过它的语音TTS有人用吗?不知道咋样

现在可以了!可以主动发消息了
还可以听呼吸声之类的声音,来决定是否发消息

1 Like

只有pro/plus套餐才能用:joy:我已经买了api了 用不起啊

1 Like