结论在先:ChatGPT这个产品的最大阻碍,是GPT本身。
TL;DR
- 聊天机器人不赚钱
- Claude证明了数学题、编程才是2B的关键,十分赚钱
- GPT5变聪明了,也没有人味了
- ChatGPT用户的Pro用户是因为模型理科能力强而订阅的
- 大多数ChatGPT用户的目标并不在此,用户会觉得难用
- 作为创作者(或许酒馆佬也认同),我要的不是一个Coding模型
GPT-5
OpenAI的发布会鄙人通宵守候,熬夜看的,就当它们宣布GPT-4演进到GPT-5,数学能力从13%飙升至94.6%,编程性能提升……额忘了。彼时便觉出,大事不妙。
经过时间的检验,论坛中的佬友达成一致的结论:智商高,话却不中听了,其中精确冰冷,令人望而生畏。
这个评价可谓是深中肯綮,假如诸君恰巧瞥见过ChatGPT导致心理问题少年自戕的新闻,与此结论相结合,就能从感性的角度理解鄙人方才所述了。为了不至于纸上谈兵言之无物,特地展示一下GPT-5对于此类问题的回复,以飨诸君。
(注1:官网现在对于此类心理问题特调过了,此处选取的是0827版本的)
(注2:网络上未能找到心理问题提示词,故根据本人素材创作,部分信息打码)
这还只是非Thinking的模式,若是开了思考,只会「给你一套快速解决方法」「深度剖析问题」「系统性引导」云云。倘若求助者心境已极度扭曲变态,触及了敏感边界,或许「我理解你……但是由于安全考虑……」就会出现。
——讲真,当他人向隅而泣,倾诉衷肠,得此回应,心平者尚且要动怒打人,崩溃者或许绝望以致轻生。
简直是落井下石,雪上加霜。
不过,OpenAI似乎对此颇为自得。谁说不好呢?
在编程基准测试SWE-bench Verified上,GPT-4o为33.2%,GPT-5达到74.9%;长上下文推理任务中,GPT-4o的准确率41.7%,GPT-4.1提升至61.7%。幻觉率下降65%,谄媚行为减少69-75%。
从任何技术指标看,GPT-5都是更优秀的模型。
OpenAI真的就没有认识到这个问题吗?
在写作和编辑任务上,o1和GPT-4o表现相当,但在需要推理的任务中o1占据主导;在创意写作方面,用户更喜欢GPT-4o的「温暖感」和「协作感」。
——OpenAI自己的人类偏好研究
这种感觉到了o3上更甚,似乎被R1腌入了味道。这种精炼高智商不说人话的特质,鄙人不知是强化学习的规讯,还是它们刻意为之。从玄学角度讲,创意需要某种不切实际的幻想,但GPT-5智商太高,就是一个Nerd,一个不解风情的书呆子。
ChatGPT并不赚钱
这是一个对于诸君可能老生常谈,非石破天惊之言,但对于大多数其他人来说,这是很新鲜的一个说法:200$/mo的订阅费,还不盈利?但根据OpenAI官方披露(官方说法最不可信了),这一档位仍然亏损,原因是「这些重度用户的密集使用模式」。
不奇怪,不奇怪,至今犹忆Claude Max花了20万美元Token费用的老兄。
从成本结构看,问题更加严峻。OpenAI在2024年将50%的收入(约20亿美元)用于推理计算,75%的收入(约30亿美元)用在模型训练上。 而且,这尚未计入7亿美元的员工工资和其他运营开支。
假如你也是Pro,多好。
但ChatGPT的转化率只有1%。Anthropic在没有转向Coding时年收入不足10亿美元,亏损却超过了50亿美元:在当前的成本结构下,通用聊天机器人业务无法自给自足。AI领域是一个泡沫。长期运营?实为镜花水月。
Vibe Coding
自从Claude Code发布以来,Anthropic的日子大为改观,好似柳暗花明。
Claude Code这一纯技术产品在Claude 4模型发布后收入增长5.5倍,拥有11.5万名开发者,每周处理1.95亿行代码,单品ARR达到4亿美元。
这是目前AI领域唯一被证明可行的商业模式,Claude Code出现之后,Gemini Cli、Codex相继发布。然后国内的GLM、Moonshot也立即跟进,支持了Anthropic接口(甚至连模型都路由妥当)——足见其前瞻性。
Anthropic准确地识别出代码生成是企业应用中的“杀手级用例”。
此言得知,兄台。普通聊天断断乎用不上1M Context。但Vibe Coding可以,而且不仅消耗的token数量远超普通聊天,对于追求自动化开发流程的企业来说是刚需。一旦集成到开发者的工作流中,其转换成本极高,客户粘性极大。
ToB的单子难以啃下,但一旦敲定,那便是成功。而且如今独立开发者、自由职业者如此之多,它也成功地吸引了众多新手浅尝。这些企业将安全高效的Claude视作一种工具,一种基础设施。
因此,模型的任何突然变化都会侵蚀企业用户对其的信任。不出错,高智商,兼具成本效益,对于客户企业来说就是好产品。
什么是ChatGPT?
这是一个文化符号,一种现象,一个词汇。
OpenAI不可能放弃这块金字招牌,但实在榨不出油水,变现艰难——看看用户都是何等人物吧!
美国三亿人群,不乏以为东京属于中国者;他们浏览X,但凡遇事则@grok iS tHaT trUE?,活脱脱资本主义巨婴。他们偶尔用,一点不重度。OpenAI没能在他们身上搞出来油水。那些文字创作者亦然,简短两句话,就可以获得自己想要的效果。
这不是OpenAI想要的。
ChatGPT的绝大多数用户不需要解微积分和写算法。
2023年夏天,ChatGPT经历了上线以来的首次流量下滑:全球访问量下降9.7%,美国下降10.3%,独立访客减少5.7%,在线时长下降8.5%,iOS应用下载量环比暴跌38%。
这个数据看似是产品常规的热度退潮,但,果真如此乎?
诸君深思熟虑足可以洞察出,这些常规用户,想要的是简单、可靠、直观、有人情味的交流体验。最好多彩,无脑。
阁下想到了谁?
DOUBAO
有人称它为「小糖包」,但不可否认,它也是现象级的。但字节跳动似乎一开始就没想在这上边赚钱。谷歌也似乎不甚想用Gemini获利,「大善人」的名号绝非空谈。此二者如此为之,所图为何?
斗胆猜测,是为了新型的互联网入口。
传统搜索引擎作为互联网世界的流量入口,历来是互联网企业争夺的战略高地。但AI大模型驱动的聊天机器人正在从根本上改变人类获取信息的方式。
问问豆包吧。
字节跳动的思路是,通过大规模、多领域、全覆盖推出AI应用。这是它最擅长的产品驱动+流量打法的「大力出奇迹」模式。阁下在豆包上搜索「饺子做法」「按摩手法」,它会呈现抖音上的内容。而短视频直播带货也早已是诸君熟知的商业模式。
「豆包」这个名称已经耳熟能详,这在中国是一个巨大优势。假若企业要在产品中嵌入AI,在流程中应用AI,这些老板、领导一定听说过豆包,先天优势。
但OpenAI难以效仿,抑或说,它正在尝试。
Sora 2的短视频平台就是一个例证,至于效果,我等且拭目以待。
结论……?
相信上文的叙述已经足够,我们简单梳理一下:
- 由于面向消费者的通用聊天机器人模式在商业上无法盈利,OpenAI被迫将战略重心转向利润丰厚的ToB市场。
- 为了在企业市场中竞争,GPT必须针对逻辑的严谨性和技术的精确性进行优化。
- 这种优化方向恰好与那一小部分付费的专业技术用户的需求高度一致,并且能让他们大规模付费,这为公司沿着这条路走下去提供了强大的商业激励。
- ChatGPT的主要受众不习惯这种优化后的模型,导致用户流失。
但是,或许本文以上所述全为妄言。还是因为Claude,它又一次启发了鄙人。
Claude 4.5 Sonnet
本人其实十分喜欢Claude 3。它的人格和风格做了很好的微调,酒馆佬也很喜欢。用来改文章是十分不错的选择。
Anthropic在Coding之路上狂热奔向深渊后,Sonnet 4.0曾经一度让鄙人失望,它的灵气似乎也被沉重的编码工作压抑了。
但,Sonnet 4.5证明编码和文学并不相悖。按照实操体验评判,它的文字能力相比4.0有明显改善。而在大模型竞技场上,它的文字子项目评分也是第一,超越了Gemini 2.5 Pro。
说到Gemini,诸君难免联想到那款神秘、惊人的模型:代号kingfall。它确实能让所有的其他模型跌落神坛。语言功底、智商、编码能力……全都断层领先、一骑绝尘。
所以反观OpenAI,他们的GPT-5为何这么偏科,答案似乎呼之欲出。
可能,是降本增效,参数缩减却想跑分更高,因而做了激进的后训练;也可能是人才竭,做不到谷歌和Anthropic的双商全面。
这只是鄙人以浅薄的见识得出的粗浅假说。这个猜测或许荒谬,或许我的意见终究在市场的检验下站不住脚。
但这就是鄙人洋洋洒洒千字的要义:GPT,不适合作为ChatGPT的底层模型,换成Claude也许更合适。
后话
鄙人确实反感Anthropic的政治作秀,然其产品之优异,亦不容置喙,得心应手是矣。于文学创意,欲求精进,或以「大」模型为基底,或是在后训练中不吝金钱,二者必居其一,并无捷径可言。
……观之今日,Claude之「安全」的长城亦日渐加固矣。
