关于怎么鉴别掺水的sol和其他高级模型,不用搞那么复杂的测试,一个逻辑题就解决问题

说明deepseek的逻辑能力还是在线的

那我试试3次独立的,第一次:第二名,第二次:第一名,第三次:第二名

能够分类讨论,给一个情况下是第一名的答案也算过关

试了下不太灵,gemini 3.1 pro(low)也答对了

测试了下手里的国模:都是 MAX 思考强度
GLM 5.2:


DeepSeek V4 Flash:

Kimi K3


k3没毛病嗷 :grin:

Gemini 3.1 Pro本来逻辑就很强,只是代码弱啊


一次就过了,感觉这个也不是很准
terra也过了

佬,我又测了一次这回显示是第一名啦

只要能答对就好说,死活答不对的就小心了


gtp max 答对了,xh 错了。

opus5一次就对了

记得Opus4.x都答不对,之前测的


ds flash max 一次答对还行

可是我用的是low的推理强度啊。

好像没答对啊,正确答案是第一名,谢谢

我这第一次问第二名,新开了两个会话,跟我说第一名,换到codex cli里面 又是第二名。。


告诉它不对,才能答对,算什么?

还得加点料才能对

这样肯定不算啊,要模型自主答题,不能借助外界信息,而且你选的思考是high, 基本上答不对的