GLM5.2的注意力似乎有点儿【过头】了? 不知道佬们有没有感觉

GLM5.2刚出的时候就宣传1M“真”上下文,这几天蹬了4~5亿Tokens吧,发现问题:
(首先GLM5.2确实Coding挺强)在长上下文的真实工程中,

到200k作用时仍然能够回归检索最开始的一些内容,
实际实际体验是在150k左右思考链会变得特别长,
观察thinking block会发现大量的wait /actually /let me等“左右脑互博”的内容,且经常是于最最开始的内容相关(比如我最开始几轮对话有一个要求它已经实现了,但是它还是会提到该事件)或者一些【关系不大的之前的内容】。这种情况随着上下文越长,越严重,在300k左右的时候,每次思考耗时都超过1分钟多。

13 个赞

感觉这个模型就是思维链超级长……

10 个赞

感觉国模的思维都比较长,我用到的 deepseek 和 glm 表现尤为明显,而且仔细看的话大部分就是在原地绕圈,在一些trivial的事情上 wait, actually, but,而且一转就是十几分钟。

8 个赞

主动多次裸 /compact 收口 session memory 能改善体验

7 个赞

不靠这么长的思维链,怎么能拿到这么好的成绩 :tieba_087:

能力不行,只能思维链凑了。就和 GPT 5.2 似的,从 5.1 到 5.2 的飞跃就是思维链长度堆出来的,也和 GPT OSS 似的,但这样真的不长久

5 个赞

估计智谱和谷歌去年似的,有 kingfall 这种相对强度的模型,但是成本太高,可能连 API 都开不起

感觉5.5pro也是硬拉长思维链,真的慢

glm5.1开始就是这样了。
很多gpt5.5会跳过的思考步骤,glm都会补上全部思考一遍。
而且他是尽量做到每有一个结论,就回头重新把点梳理一下,再重过一遍。
逻辑上的框架他是无敌的。
如果你用它来做复杂的小说大纲,就会发现比claude gpt好用多了,因为它真的会把每个点都思考到,减少了很多”忽然感觉这个设定似乎跟某个点有冲突啊“的情况。

4 个赞

用claude code就好了

看不到思维链,只看到可用的上下文

别看思维链就好了,你就说好不好用吧。那个上下文,真的好用

但是我觉得glm5.2的上下文特别经用?反正我在zcide里面使用,上下文百分之二十都很少超过,但是在codex里面,时不时就要压缩

我一般200k左右就开新会话或者用subagent了:joy: 上下文太大的话token是在消耗太快

glm这个上下文非常强,充分利用才能发挥实力

尤其是大型项目的debug,真的能把复杂的深层次的问题挖出来

1 个赞

其实我感觉 fable 也是这样,就是设置很多验证点,完全没有 a 出吹的神乎其神

其实claude和GPT的思维链也曾经长的要命过,刚出来的opus 4.6以及gpt5.2之类的,只是后来对思考预算的动态调整技术提高了,简单问题不会长考,国产模型还是怼思维链的阶段

这个太对了,DeepSeek的思考效率是真的很低,动不动就是: 事实上:nerd_face: :backhand_index_pointing_up: 和 actually:nerd_face: :backhand_index_pointing_up:

为了 1M 的召回率 只能在后训练强约束 CoT了

我觉得glm 5.2比claude 4.6 opus还要好,目前5.2已运行29.7k tokens还在继续

claude 系列都这样,似乎只有 fable 好一点