您现在的位置是:首页 >> AI资讯

字节 Seed 团队发现 DeepSeek“抽风”原因,长上下文可能性能漂移

AI资讯 2026-10-09  阅读:156
该研究评估了基础版和后训练版的 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro,以及后训练后的 DeepSeek-V4.1-Flash。

10 月 9 日消息,字节 Seed 团队今年 9 月底在预印本平台 arXiv 提交了一篇论文,谈到分块 KV 缓存压缩带来的相位敏感性,直指 DeepSeek“抽风”原因。

该研究评估了基础版和后训练版的 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro,以及后训练后的 DeepSeek-V4.1-Flash。

模型通过分块 KV 缓存压缩以固定步幅将连续标记的窗口压缩为更少的缓存条目,能够减少长上下文推理的内存和注意力成本。

然而,这种压缩还引入了一个新的位置坐标:Token 的相位,或其相对于压缩窗口边界的位置。

该团队发现使用这种压缩的模型中存在系统性不对称性:相同的信息在一个阶段很容易检索,但在另一个阶段很难检索。团队将这种检索性能的周期性变化称为相位敏感性(phase sensitivity)。

在采用此类压缩的大型开放权重模型中,长上下文检索准确度在各个阶段之间可能相差高达 40 个百分点,从而揭示了平均基准分数可能掩盖的周期性弱点。

附论文链接:

https://arxiv.org/abs/2609.36322

如果您对本站有任何建议,欢迎您提出来!本站部分信息来源于网络,如果侵犯了您权益,请联系我们删除!

相关标签:字节 AISeedDeepSeek