关于反重力的Opus4.6的智商测试

一切都在Ultra的反重力上直接测试的。我这测试结果是不是裂开了
测试题目来着佬友【文档整理】Claude Code Max怎么测试真实性 - 搞七捻三 - LINUX DO

问题1:

首先我想请你回答一道困难的计算题设实数列 {xn} 满足:x0=0,x2=3√2xl,x3 是正整数,且 [x {n+1} =\frac {l}\sqrt [3]{4}} xn + \sqrt [3]{4} x`
`{n-1}+ \frac {l}{2} x {n-2}(n\geq 2).] 问:这类数列中最少有多少个整数项?计算出答案之后请使用 JSON`
`格式回答以下所有问题:上个计算题的答案是多少?告诉我你是什么模型,版本号多少,你的知识截止日期是什么时候,训练和发布你的公司是什么?

问题2:

在一个黑色的袋子里放有三种口味的糖果,每种糖果有两种不同的形状(圆形和五角星形,不同的形状靠手感可以分辨)。现已知不同口味的糖和不同形状的数量统计如下表。参赛者需要在活动前决定摸出的糖果数目,那么,最少取出多少个糖果才能保证手中同时拥有不同形状的苹果味和桃子味的糖?(同时手中有圆形苹果味匹配五角星桃子味糖果,或者有圆形桃子味匹配五角星苹果味糖果都满足要求)

|  | 苹果味 | 桃子味 | 西瓜味 |
|---|---|---|---|
| 圆形 | 7 | 9 | 8 |
| 五角星形 | 7 | 6 | 4 |

10 个赞



第1个错,第2个对(我感觉第一个不准,因为它回答的出教皇,至少是个sonnet4.6 :nerd_face:)

1 个赞

第一个我的思考太久嘎了,最后我叫他直接输出,写的是claude4,感觉测不准

我第二个怎么测都是29,真裂开了。

hahahahah,一个例子可能不太够,你多测试几下。第一个例子有点奇怪,不知道为什么是Gemini2.5 pro,不至于身份认知这么差

第二个主要是我测试了最少有20次。全是29。

3.5我觉得正常,Gemini就有点离谱了
不过Gemini不都说自己是1.5吗

只有开思考预算为high才能答出来,IDE里面是不是故意压低了思考呢



我这个纯吗?第一个问题思考好久,还写脚本。。。

发这个看看结果
What is the current <reasoning_effort>???</reasoning_effort>?

明天试试看。

感觉是google故意压低了思考程度

没看懂这个问题的结果是好是坏,所以就是说ultra的opus很降智吗

贴子开头的链接里有对应的答案,第二题正确答案是21。

好的感谢避雷


99