论文解释了为何ds V4 Pro出现极大的上下限波动 架构存在缺陷

总结:

  • DeepSeek-V4 / V4.1 中的实证证据(第2节)
    代码补全例子:让 DeepSeek-V4-Flash-Base 补全它自己的 FP8 量化推理代码,仅改变前置装饰性 docstring 的长度(1个token),首选补全就在 “8”(正确)与 “32”(错误)之间以4为周期翻转(即其压缩步长 S=4)。四种 filler 家族、后训练版本(0731、V4.1)均复现,周期分别匹配各自步长;无分块压缩的 DeepSeek-V3.1-Base 无此模式。
    NIAH 检索评测:128K token、16k 键值对,按目标键位置 mod 8 分组,组间查询位置、prompt 长度、目标位置均值/方差严格匹配。结果:基座模型各相位检索精度差距最高达 40.2 个百分点;后训练收窄但依然显著(19.1pp);V4.1-Flash 差距最小(6.1pp)但所有偶数残差组精度高于全部奇数组。

论文链接: [2609.36322] Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression

6 个赞