一张图测试ai识图能力(真·识图,我看了一些别的识图帖子,要不就是太老,要不就是没意义)⭐寻找佬补充claudeの结果

测试图片:

三种颜色需要模型准确判断:①亮色的火柴棍,即可以移动的火柴棍;②暗色的火柴棍,即不可以移动的火柴棍;③灰色,即没有火柴棍的占位。(允许模型判断不出②,因为可以理解为默认)

实际上,测试的应该是模型的“识图:plus:思考”拼接能力。模型需要识别出三种不同的颜色,并且思考深度要达到这一层。很难有模型直接思考到这一层,需要足够细致且不断纠错。

部分结果:

国产主流模型:

豆包(专家级模型,注意必须“专家级模型”)竟然可以顺利完成,惊讶了:rofl:,也是思考了很多次,其实就是模型不断纠错,按颜色等信息判断哪里有火柴哪里没有的过程;

kimi一直也不让用思考,说高峰时段算力不足(我也不知道为什么天天算力不足),我觉得kimi的识图能力应该也可以完成,但是现在没法测,不让思考;

其余全军覆没,Qwen、GLM、deepseek(不妨截图了,笨的一批 :rofl:)。

不过,严谨来讲,deepseek按理不应该参与这次“比赛”,因为人家本身就没有图片输入,只有图片转文字输入,没有识图能力。

国际主流模型:

gemini,依旧识图能力一哥,没得比;

claude,我测不了,我就没登上去官网过(秒封懒得搞) :rofl:用api不知道是否是模型原生识图能力,所以没办法。大佬可以补充:star::star::star:;

gpt,懒得搞team,不用5.2测也没什么意义是吧。我在codex里测试了一下,不知道和网页原生版识图能力是否有很大区别,大佬可以补充。codex里测试完全正确,我觉得有些出乎我的意料;


grok,用日常浏览器测的,全中文界面不确定是否有降智等可能,选择的依旧是专家模式。依旧拉跨 :rofl: :rofl:搜索能力依旧“一流”,连这都要搜索 :rofl:


13 个赞

国产的网页版应该都会偷偷调用小参数模型减少算力消耗,毕竟都是免费产品而且是无限免费,我猜的。我觉得感觉不至于这么弱智。

app降智有这么厉害吗?
其实按理说这个识别还是有点难度的吧,如果不注意颜色问题,很容易识别成别的数字的

佬可以去阿里百炼试试,qwen3.5plus的识图应该没那么弱


确实比千问app强,但依旧识别错误,输出部分死循环。

确实不差,只有减号识别错了。(减号识别错了,为啥2和7还能对? :distorted_face:)

也就是说qwen3plus的识图还是不如seed2pro?那阿里这轮输完了:rofl:,推理和多模态都没打过字节,视频模型和图像模型也输了

kimi的结果。。

尴尬了,还以为kimi识图挺强呢

感觉app降智了。。

豆包重新试了几次,有不小概率出错。不过app里估计不是满血版,已经很强了。(不过其实,不确定豆包是看出来的还是推断出来的,万一是推断出来的,那就算是蒙的了)
不过这波确实是没打赢 :rofl:

你开会员了吗 我这思考完全用不了
(开会员都降智也是 :smiling_face_with_tear:

有会员,之前官方抽奖中的小包一个月

seed2pro的满血在火山引擎有免费额度