9.9-9.11 答案是?

Opus 4.7 连这也答不对 不可能吧
不论官方还是野榜 Opus 4.7比4.6高分 难道跑分也造假?
正当我去求证时
走歪了

6 个赞

本来用跑分来判断大模型是否牛批就是一个伪命题啊!

1 个赞

别为难AI了,你这个问题去抖音问,都有一半人答不上来哈哈哈哈

9 个赞

随一个,我说都是蒸馏的,谁蒸馏谁还不一定呢(今天已经带着这张图走了很多地方了)

2 个赞

作为A/的当家旗舰数学能力还不如生图模型,也是无敌了

4 个赞


G老师稳稳接住了

1 个赞


专家模式还是能算对的

1 个赞


感觉不如grok 4.3 … 智力上
grok竟然答对了,这下opus倒吸牙膏了

1 个赞

哦,没有怀疑 DeepSeek 的意思,我是说 4.7 指不定蒸馏 DeepSeek 了呢(笑)

1 个赞


gemini略胜一筹啊

当然,9.11-9.8 最开始就是 DeepSeek 的思想钢印,已经被整活几个月了:rofl:

1 个赞

读题错了。 题目不是9.9-9.11吗?你图里的题目跟9.9-9.11的逻辑不一样

注意力变差了,21那题都答不对了,有点国产模型的味道了 :laughing:

我知道,DeepSeek 的思想钢印就是 9.11-9.8,所以我就懒得换了,还没测过 claude 这个,在 ds 上怎么样

这是模型标记 正如 gpt4o后

“给主人留下些什么吧“

Opus 4.7 可以试试


我和它说不对,他还给我解释一通

还说自己不傻 :distorted_face:

1 个赞

Opus 4.7 视觉分辨率扩大三倍

大胆推测 Opus 4.7 具备生图能力 所以改了分词器

但因某些原因 封印了?

也算是经典了,你让他数个字数甚至都数不明白。我让它帮我数今年洛谷愚人节的追忆那个题,结果数了半天总是会错,还是得人来

1 个赞

这个前段时间记得就被拿出来说道deepseek,现在回旋镖扎到opus 4.7上了

其实 4.6 也不能稳答对的,有不小的概率打错,a​:divide:一直没改。

1 个赞