测试图片:
三种颜色需要模型准确判断:①亮色的火柴棍,即可以移动的火柴棍;②暗色的火柴棍,即不可以移动的火柴棍;③灰色,即没有火柴棍的占位。(允许模型判断不出②,因为可以理解为默认)
实际上,测试的应该是模型的“识图
思考”拼接能力。模型需要识别出三种不同的颜色,并且思考深度要达到这一层。很难有模型直接思考到这一层,需要足够细致且不断纠错。
部分结果:
国产主流模型:
豆包(专家级模型,注意必须“专家级模型”)竟然可以顺利完成,惊讶了
,也是思考了很多次,其实就是模型不断纠错,按颜色等信息判断哪里有火柴哪里没有的过程;
kimi一直也不让用思考,说高峰时段算力不足(我也不知道为什么天天算力不足),我觉得kimi的识图能力应该也可以完成,但是现在没法测,不让思考;
其余全军覆没,Qwen、GLM、deepseek(不妨截图了,笨的一批
)。
不过,严谨来讲,deepseek按理不应该参与这次“比赛”,因为人家本身就没有图片输入,只有图片转文字输入,没有识图能力。
国际主流模型:
gemini,依旧识图能力一哥,没得比;
claude,我测不了,我就没登上去官网过(秒封懒得搞)
用api不知道是否是模型原生识图能力,所以没办法。大佬可以补充![]()
![]()
;
gpt,懒得搞team,不用5.2测也没什么意义是吧。我在codex里测试了一下,不知道和网页原生版识图能力是否有很大区别,大佬可以补充。codex里测试完全正确,我觉得有些出乎我的意料;
grok,用日常浏览器测的,全中文界面不确定是否有降智等可能,选择的依旧是专家模式。依旧拉跨
搜索能力依旧“一流”,连这都要搜索 ![]()








