Qwen 3.8的Agentic能力很强吗?Artificial Analysis Agentic第二?

8月7日,阿里Qwen3.8-Max在智能体能力(Agentic Index)排行榜中,超越GPT5.6,仅次于Claude Opus5,位列全球第二。8月6日,Qwen3.8-Max曾短暂达到第一。
这是Qwen3.8-Max被低估了,还是Agentic Index有水分?
大家实际使用体验怎么样?

3 Likes

你知道吗?我从来不相信这些厂商自己的评分,唯一相信的也就是DS自己的评分了。已经出了好几天了,但论坛里几乎看不到人们的讨论,所以你就知道真实水平了。要么是价格太高用不起,要么就是虚假宣传。

4 Likes

阿里的模型一直都是跑分没输过,体验没赢过

6 Likes

Qwen的历史信用确实不佳,刷分小能手。实际能力更关注社区的评价。 :sweat_smile:

4 Likes

能力还行 就是太贵了

只有L站谈论多的模型和厂家才是有实力的 [狗头]

咱们的Queen除了3.7max之外一贯benchmaxxed

没有给到人一种惊艳的感觉,除了给自己给了高位的排行榜之外。包括3.7max,中规中矩的走在别人后面。

DS也不能相信,跑分全超GLM5.2,实际呢?用自己的harness跑出来的跑分,然后自己的harness又没发布,实际性能只能说是5.2的下位平替。

参考手机跑分,这种分数参考价值感觉都不是很大,都是猛猛吹自己怎么样怎么样,glm5.2 跑分出来还吹自己 4.8 水平呢,实际拉完了

前几天已经打到第一了,不知道被谁又踢下来了 :grinning_face_with_smiling_eyes:

或许已经买通了竞技场,拿下了题目,狠狠喂答案
反正都是商业竞争

1 Like

只要有基准,总能刷上去,这个风气真的很差