arena.ai 上的 qwen3.5-max-preview 的一些观察

update:又测了三次糖果题,qwen3.5-max 给的都是 29,看起来是我第一次测得运气太好了


首先,众所周知在 qwen3-max-thinking 之后 https://chat.qwen.ai 上的思维链就变成总结版的了。但是 https://arena.ai 上的 qwen3.5-max-preview 的思维链应该还是原始的(逐个 token 蹦出来的),但是显示的思考时间会有一些问题。

其次,qwen3.5-max-preview 的思维链是比较有条理的,类似 glm-5,与 DeepSeek 那种狂野的思维链差别较大。

昨天测了一下这个帖子里的这个题,qwen3.5-max-preview、gemini-3.1-pro 和 gpt-5.4-high 是对的,gpt-5.4-mini、claude-opus-4.6-thinking、DS 网页端和 qwen3.5-plus 都做错了。

但刚才我又测了一下 CF 上一道 k2.5 和 gemini-3.0-flash 都能做出来的题,qwen3.5-max-preview 测了两次,思路都完全错误,且第二次给出的代码漏了头文件。

总结:推理和逻辑能力可能有一定的提升,但是没必要抱太大希望,佬们还是看看远处的 V4 吧

8 个赞

老实说还想用国产模型来弄弄cc的hhh

其实Opus4.6多Roll个几次,是能做对的,可用这个题检测一下渠道纯不纯

1 个赞

唉,千问传统的小模型顶尖,大模型拉胯

小模型现在得看 nemotron 了(

30B 拿下 IOI 和 IMO 金牌已经无敌了。

qwen的大模型系列一如既往的拉跨,丝毫没有意外:relieved_face:

1 个赞

那个我试不了哈哈,有什么体验渠道吗?我本地只有8g显存,qwen3.5也只能跑9b q4量化的

为啥我在 arena.ai 上测试 qwen3.5-max-preview 那个三种口味的糖果问题是稳定得到错误答案啊?

原团队搞不了的事
就算换掉头头一时半会也救不起来 :innocent:

是的,我也是

qwen的max一向都很拉

希望qwen4能奋起直追吧


难不成我用到假的 qwen 啦(?

很怪

我问了5次都答不对,可能我用到假的了吧

这个模型我本地部署了,感觉coding很不行,测了一些写代码有关的问题回答得很差

写工程的话应该是正常的吧。

毕竟 IOI 是算法竞赛,和软件工程没啥关系

哪怕谁都放弃小模型, Nvidia 也最应该有动力去做小模型
不过也不一定,毕竟个人用户购买力有限