Hugging Face transformers合并GLM 5,参数估算

Hugging Face transformers于2026年2月8日通过了编号为43858的拉取请求,完成了对新架构GlmMoeDsa的合入。Add GlmMoeDsa by Cyrilvallez · Pull Request #43858 · huggingface/transformers · GitHub

从代码实现来看,GLM-5采用了78层Transformer解码器结构。在计算模式上,它延续了智谱AI近期的混合设计思路:前三层保持为稠密(Dense)层,从第四层开始全面转为稀疏(Sparse)的混合专家架构(MoE)。模型配置了256个专家,单token激活8个专家的策略,这种设计能够在维持庞大参数量的同时,通过计算资源的按需分配来兼顾推理响应速度。

专家总数:256
共享专家:1个
每个token激活8个专家
专家维度:2048
上下文能力:202K
词表规模:154880

对比GLM 4.5系列:
总专家数:160个 路由专家(Routed Experts) + 1个 共享专家
上下文能力:128K

估算GLM5模型大小在700-800B之间,激活参数不变

OR上的pony上下文能力也是200K。提前恭喜GLM:tieba_002:

11 Likes

GLM还是很有发展前景的

1 Like

据传参数超越deepseek

2 Likes

是的,参数有加了,但是后端还是差点味道,没GPT那么心细,延续了Claude的高速[此处并非指输出速度]和文风,唯一气愤的一点就是,Air没有消息表示要更新,导致我这几天用的时候是Haiku混新模型一起用

5 Likes

确实像claude的文风

1 Like

不错,真就慢慢的追上老美的top模型了。国产这么搞下去,就差芯片了。

有理有据,赞!