AI产业链 / L4-基础大模型 / 国产大模型 · 2026-10-09

📅 2026-10-09🏷 AI产业链 / L4-基础大模型 / 国产大模型

字节团队论文揭示 DeepSeek-V4 长文本「相位敏感性」:检索准确率随信息位置波动最高差 40 个百分点

字节跳动 Seed 团队联合普林斯顿、斯坦福、加州大学伯克利研究人员,于 9 月 28 日在 arXiv 发布预印本论文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》,系统揭示 DeepSeek-V4 系列在长上下文场景下输出不稳定的技术根源。

分块 KV Cache 压缩把连续的 Token 按固定长度切割,每段通过一个可学习的门控层压成「小摘要」,从而大幅减轻长上下文的显存压力,这是 DeepSeek 的省钱杀手锏。

测试中,研究人员用 DeepSeek 开源的 FP8 推理代码给 DeepSeek-V4-Flash-Base 出填空题,不修改任何核心代码,只在前方装饰性注释里逐个增加等号。正确答案概率在 71.3% 与 91.5% 之间周期性翻转,波动周期恰好 4 个 Token,与模型压缩稀疏注意力的步长吻合。

在约 12.8 万 Token 的长上下文检索测试中,研究团队在材料里放入 1.6 万组对应记录,保持材料总长、提问位置与记录对应关系不变,只调整填充文字长度让目标记录挪动几个位置。V4-Flash-Base 不同位置的检索准确率最大差距达 40.2 个百分点,V4-Pro-Base 达 34.8 个百分点。经后训练的 V4-Flash-0731 缩至 19.1 个百分点,V4.1-Flash 进一步缩至 6.1 个百分点,周期性差异仍未消除。

研究团队以 Qwen3-0.6B 为底座从零训练多组对照模型,所有采用分块压缩的模型都出现与压缩步长对应的周期性波动,全注意力基线没有,证实这是分块压缩设计本身引入的结构性弱点。机制分析显示部分注意力头形成了针对特定相位的「相位专门化」。团队将现象命名为「相位敏感性」,并建议评估此类模型时应把同一信息置于不同压缩相位分别测试,而非只看整体平均准确率。

观点

  1. 分块 KV Cache 压缩是 DeepSeek 压低长上下文成本的核心手段,这次暴露的是省钱与可靠性之间的直接权衡——成本优势并非没有代价,代价此前没有被量化过。
  2. 平均准确率会掩盖系统性失效。同样的材料、同样的答案,仅仅因为位置不同,模型就可能彻底失准,而整体基准分数完全看不出来。评估采用分块压缩的模型时,必须把同一信息放在不同相位分别测试。
  3. 这不是 DeepSeek 一家的问题。凡采用分块压缩或稀疏化的模型都可能中招,包括开源的 Llama 3 系列,影响面覆盖当前主流的长文本降本技术路线。

来源:论文 arXiv、腾讯新闻、新浪财经