说明deepseek的逻辑能力还是在线的
那我试试3次独立的,第一次:第二名,第二次:第一名,第三次:第二名
能够分类讨论,给一个情况下是第一名的答案也算过关
试了下不太灵,gemini 3.1 pro(low)也答对了
Gemini 3.1 Pro本来逻辑就很强,只是代码弱啊
佬,我又测了一次这回显示是第一名啦
只要能答对就好说,死活答不对的就小心了
记得Opus4.x都答不对,之前测的
可是我用的是low的推理强度啊。
好像没答对啊,正确答案是第一名,谢谢
我这第一次问第二名,新开了两个会话,跟我说第一名,换到codex cli里面 又是第二名。。
这样肯定不算啊,要模型自主答题,不能借助外界信息,而且你选的思考是high, 基本上答不对的











