DeepSeek“抽风”原因曝光:分块KV缓存压缩惹的祸
2026-10-09 09:30 · 0 阅读 · 来源:百度热搜「DeepSeek“抽风”原因曝光」 · AI 辅助整理

近期,字节Seed团队在arXiv提交的一篇论文,对DeepSeek等大模型在长上下文任务中偶尔表现不稳定的现象给出了技术解释。这一现象被不少用户形象地称为“抽风”——模型有时能准确回忆并利用长文本中的信息,有时却似乎“忘记”了前面出现过的内容,回答质量出现明显波动。
论文指出,问题根源与模型采用的分块KV缓存压缩技术有关。随着大模型处理的长文本越来越长,键值缓存(KV Cache)占用的显存会急剧膨胀,成为部署和推理的瓶颈。为了降低内存成本,许多模型选择对KV缓存进行分块压缩,只保留部分关键信息。这种做法确实能节省资源,但也引入了一个新问题:相位敏感性。简单来说,相同的信息在模型处理的不同阶段,被检索到的难度并不一致。有些阶段信息保留得较完整,检索准确;有些阶段则因压缩损失而难以被有效提取。
研究进一步发现,在采用此类压缩方案的大型模型中,长上下文检索的准确度在不同阶段之间最大可相差40个百分点。这意味着,同一个问题,如果关键信息恰好位于模型“状态好”的阶段,回答就更可靠;反之则可能答非所问。这解释了为什么用户会感觉模型时而聪明、时而糊涂,也说明“抽风”并非随机故障,而是与缓存压缩机制的结构性特点相关。
对于普通用户而言,这一发现提醒我们,长文本任务中的模型表现波动可能并非偶然。未来,如何在节省内存与保持检索稳定性之间取得更好平衡,将是模型优化的重要方向。相关团队也可能会针对相位敏感性调整压缩策略,让长上下文处理更加可靠。