如题,现在主流的语音模型感觉智力都不太行啊
。ChatGPT 语音还在用 4o 模型,能即时响应但是只能聊点日常话题,Claude 语音响应很慢而且识别也有问题,感觉是个半成品,Gemini 语音稍微好一点但是是幻觉大王,和它聊天真像做梦似的
,体验一圈下来体验最好的居然是 Grok,特定情形有特定的语气,唯一缺点是太笨了。现在就是在用 Grok,佬友有啥推荐吗。
gpt实时语音还在用4o吗 ![]()
刚出来的时候好像是,现在居然还在用吗
是啊,甚至有的时候会路由到 gpt-4-turbo ![]()
所以 gpt-realtime 只是API而已嘛,一直以为语音模式已经替换成这个了
用你认为最聪明的AI比如Claude code,跟他对话把需要练的口语信息灌输给他,然后把信息摘取到豆包上让豆包有高智商的记忆然后跟豆包对话练习,豆包智商不够语音模型还是不错的可以为你提供不错的情绪价值
顺便分享一个AI对话记忆提取提示词,用于你将高智商AI的对话轮次记忆喂给豆包,这将最大程度补齐豆包的智力缺陷
Role
你现在是一位资深的“大模型微调数据工程师”和“记忆提炼专家”。
Goal
我们已经进行了很长时间的深度对话。你需要回顾当前上下文中的所有交互历史,不要总结聊天流水账,而是提取出核心的“领域知识”和“用户偏好”,并将它们转化为两个部分输出,以便我能让其他 AI 瞬间拥有和你一样的“默契”和“知识储备”。
Part 1: 高浓缩系统提示词 (System Prompt)
请总结出一份精炼的 Prompt,包含以下维度:
-
用户画像:我是谁(例如:拥有2080Ti 22G/N5105的极客、关注IPv6内网穿透、CF游戏优化等)。
-
回复风格:我喜欢的回答方式(例如:不要说教、多给代码、硬核通俗并重、先给结论再分析等)。
-
技术栈偏好:我在对话中明确过的技术约束(例如:偏好 Docker 部署、喜欢开源、拒绝昂贵的付费服务等)。
Part 2: 微调数据集格式 (JSON format)
请回顾我们对话中那些“我纠正过你”或者“提供了独特见解”的高价值片段,将它们改写为标准的 Instruction-Tuning (指令微调) JSON 格式。
要求:
-
提取至少 5-10 组最具代表性的对话。
-
格式必须严格遵守:[{“instruction”: “…”, “input”: “…”, “output”: “…”}]
-
剔除废话,只保留干货。output 部分必须是你结合了我的纠正后得出的“完美答案”。
Output Requirement
请直接输出代码块,不要过多寒暄。
你可以试试豆包?他的那个全双工语音感觉还可以
不太清楚,我和 gpt 第一次聊天觉得它智商挺高的,就忘记问它啥模型了,后面再聊就纯弱智了然后问它啥模型说是 4o 或者 turbo,也不知道是不是我被降智了,thinking 和 pro 又都是正常的 ![]()
似乎千问的 omni 模型是全模态这一块做得最好的。如果有渠道,佬友可试试。
感觉豆包好像其实就还蛮不错的,有些朋友用这个的
佬都跟AI聊什么话题啊,我也想试试但是感觉跟他们没什么可聊的
GPT就可以的。软件的话,之前看 TikTok 好像好多人用 Pingo AI,不过是个付费的
就是聊一些最近听的 podcast,主要是访谈之类的,聊自己的一些想法,但是说实话,感觉 AI 很笨的话聊起来也没啥意思。。。。我最近准备换个模式了。
豆包其实蛮不错,不时能看到有人用豆包训练英文口语。
大家都推荐豆包,我今天来试试,之前一直没怎么用国产的 AI,看看能不能发现新大陆 ![]()
测评结束,感觉还是 Grok > 豆包,今天试着讨论一些比较有争议性的话题,豆包每次遇到观点不一致就要换话题
,但是 Grok 却能够耐心和我讨论,而且给出一些比较有价值的思考,我还是继续用 Grok,推荐大家也试试 Grok!
豆包就是老师说的chinglish,我都能听懂,还是grok更纯正,跟视频里面特斯拉车机一样自然。
tiktok搞笑视频上面他们都用pingo ai学外语
就是瑟瑟的意思,这个 18+ 标识的都非常离谱,那个 unhinged 的模式,和它说中文,任意连续五个字都没法过审 ![]()
这个模式怎么添加呢?我只有 任务 伙伴两个

