探讨group size 大小对量化的影响

测试显卡为rtx 3090,sglang版本:0.5.6.post3.dev9504

鹈鹕骑单车测试

最常见的group size = 128

group size = 64

group size = 32

可用kv cache

group size token capacity
128 121856 (119k)
64 106560 (104k)
32 77504 (75.7k)

gemini spark一句话总结: 传统模型依靠无状态的纯 Softmax 注意力天然容错,而 Qwen3.8 采用了会逐步递归累积误差的 GatedDeltaNet 线性循环注意力与 256 维 QK-Norm,必须依赖 group_size=64 的细粒度尺度才能防止隐状态数值发散与注意力几何畸变。

个人觉得单流使用还是用unsloth的q4 km好一点,虽然速度慢了点

1 个赞