字节发现 DeepSeek 隐藏 Bug,加点空格,模型翻车
事件
字节跳动团队在论文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》中,点名 DeepSeek V4 系列模型存在“神鬼二象性”问题:同一个问题问两次,仅多敲几个空格,答案可能天差地别。起因是让 DeepSeek-V4-Flash-Base 补全一段 FP8 量化函数,在代码前加一串装饰性等号后,模型把正确结果 8 输出了 32,且错误与等号数量直接相关——等号数除以 4 余 0 或 1 时错误率高达 71.3%,余 2 或 3 时正确率回升到 91.5%。
问题根源在于 DeepSeek 为缓解长上下文显存压力采用的分块 KV Cache 压缩技术。该技术把连续 Token 按固定长度切块,通过可学习门控层压缩成“小摘要”,但每个 Token 在压缩段内的位置(相位)因此变得关键:排到强势槽位的 Token 被加权保留,排到盲点槽位的几乎被忽略。研究人员还发现注意力头形成相位专门化分工,某些排位天然成为薄弱环节。在 128K Token 的“大海捞针”测试中,DeepSeek-V4-Flash-Base 不同位置间准确率最大差距达 40.2%,Pro 版为 34.8%,后训练优化后仍有 19.1% 和 14.8%。
DeepSeek 在 V4.1-Flash 中把压缩步长从 4 砍半到 2,准确率差距降至 6.1%,但未彻底消除。字节团队用 Qwen3-0.6B 架构从头训练验证,发现所有采用分块压缩的模型都出现周期性准确率波动,全注意力基线则没有。这意味着在“把长文本成本打下来”的潮流中,凡采用分块压缩或稀疏化技术的模型,如开源 Llama 3 系列,都可能存在类似盲区。对用户而言,关键条款若卡在信息盲区,模型可能直接无视并给出相反结论,而错误诱因可能只是几个空白字符,排查难度极高。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:雷锋网*