gpt6sol/gpt-6-sol?可能是5.5或者5.4降智版的换名

-因为个人习惯在新模型是否可用前,会进行一系列智力和额度消耗测试,以及问gpt模型对比。然后发现,6sol和6luna:很拉。

2026.09.25-先说结论:

-如题,6sol和luna,感觉就是5.5和5.4,智力简直惨不忍睹。
-6sol和luna的max,还不如5.6sol的low。

下面图,所有测试都是同一个号的,我为了测试额度消耗,顺便测试了多个推理模型
-其实测试的这个号,不是第一个号了,是第三个号,前面的信息没做记录,因为当时没想过要发帖子,所以,其实不仅只有图中的测试量
-但是前面两个号更多的测试是测Astra和5.6sol的对比,后来测试到6sol和6luna,发现low和max都流口水(全错)之后,就没测这俩其他推理程度了。

糖果测试

6astra和5.6sol,智力正常,无错

6sol和6luna,流口水(这里6sol-max对了1个,我也是笑了,前面10轮都全错)
5.6sol-low都是一直全对,比它俩的max聪明

额度消耗如下图,单位是plus-5小时额度
-个人认为,astra的low和medium额度消耗比xh更高,应该是经历了更多轮的推理。即,low和medium虽然价格更低,但相同问题情况下需要多次推理才出结果。而xh一次就推出结果,所以xh消耗更低。

糖果题测试的额度消耗

GPT给的模型对比信息如下图(个人感觉:吹牛、打了草稿):

gpt回答信息


怀疑账号降智的

-其实水杯提我也并入糖果题的程序了,但是这个回答太慢,所以上面就还是用糖果题来展示结果

水杯和醍醐


补充测试

水杯提和糖果题

-结果很讽刺。codex水杯提、本地水杯提和糖果题对比
-水杯提能完成,糖果题却是流口水。
-个人还是觉得是6sol和luna是降智品,因为虽然它回答对了水杯提,但是它无法回答糖果题。

新的分歧点:

有部分人发了单个在codex中测试的结果和数据来看,发现正确的,但是我觉得这个可能存在codex的一些agentsmd这类文件以及项目、缓存、记忆等因素影响,你的测试结果不一定是单纯的模型推理结果,可能是查询结果。
最明显的是,我在本地部署的水杯提和在codex(新线程、没有任何项目文件)中提问的水杯题,回答时间分别是:本地部署是380.9s,而codex是10min46s(646s)

修复

-至少,需要在oai进行更新/修复之后,估计才能达到gpt回答的程度,至于什么时候修复,各位佬快去催tibo吧。

5 个赞

别这样侮辱5.5 :joy:6 sol其实就是terra换了个名

2 个赞

你这个降智了吧,我用着勉强能接受,astra规划和验收,sol xhigh实现

2 个赞

哈哈哈 5.6terra其实还是可以的,我印象中也不会像6sol、luna这样错这么多。
不过我很少用terra所以几乎没做过它的测试,只有刚出5.6时测过,现在懒得测了,反正不会用它

真的是5.4吗

当时用5.4感觉还是挺好的

数据和对比放在这里,如果你觉得还是降智了,那我也没别的数据反驳了。
但是你至少得先找出降智的证据,真降智了,你看我上面的6astra和5.6sol的测试是怎么测对的?
你可能想看到的水杯和醍醐来判断是否降智。


1 个赞

确实,5.6 terra做糖果还是没问题的,这6 sol糖果都做不明白,下限太低了

只想说公司项目之前一直5.6sol medium跑, 极少写出bug, 昨天用了一天gpt6索嗨, 给今天的我造了一天的工作量(本来准备摸鱼等放假了)

你只是"使用感受","使用感受"这种东西,如果你没有切实、标准的答案和对比,你根本不会意识到到底是否降智。
直到,有重大错误,明显到你的"使用感受"或者眼睛能看到了,那就很重大很离谱的错误了。

(帖子已被作者删除)

GPT6 Sol今天用了一下,感觉还不如Gemini 3.8 Flash,这Sol Max耗了我70%的5小时额度证明了已经写在接手文档里的事实,不想说啥了 :sweat_smile:

1 个赞

哈哈哈哈我本来也想用6sol的,但是我习惯在新模型要进行一些系列测试和gpt对比后才会用,以免被坑。

哈哈哈刚出那会肯定好呀,但是后来5.5和5.4不是流口水了吗,尤其是5.5哈哈哈哈

我用了一天的 gpt-6-sol, 智力正常,水杯,小球都正常返回,思考等级 sol-xhigh, max 其实不适合日常使用,你换成xhigh试试

有部署糖果测试过吗0.0
我感觉在codex中问,它背后会自己进行查询、搜索。

你的截图,是6sol-xh吗?我现在打算在codex中试试

糖果的也有,而且我感觉你这个思考的token数据是不是有点少,我这个思考了6min,推理16K,输出18K, 前面几次是我agent.md,让他加载工程级别的memory,这个工程是新的,所以没有memory

同款遭遇。让他帮我调服务器,他花了半个多小时时间、把一个我一开始就告诉了他的已知条件作为解决方法交付给我了。

是的,就是因为6sol和luna的降智,所以没有输出和思考的token,
但是5.6sol和astra又是正常的,所以我才会说6sol和luna是还没完成的降智品。

水杯提还在跑,待会就知道答案了,不对,如图,它已经有答案了,在给推理

结果很讽刺。
水杯提能完成,糖果题却是流口水。
我觉得你可以部署一下糖果题进行测试

之前5.6时期就遇到过单个模型降智
我这边目前的测试6sol low糖果概率答对,Medium就是百分百答对
感觉现在降智也分很多种了