✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

字节发现 DeepSeek 隐藏 Bug,加点空格,模型翻车

事件

字节跳动团队在论文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》中,点名 DeepSeek V4 系列模型存在“神鬼二象性”问题:同一个问题问两次,仅多敲几个空格,答案可能天差地别。起因是让 DeepSeek-V4-Flash-Base 补全一段 FP8 量化函数,在代码前加一串装饰性等号后,模型把正确结果 8 输出了 32,且错误与等号数量直接相关——等号数除以 4 余 0 或 1 时错误率高达 71.3%,余 2 或 3 时正确率回升到 91.5%。

问题根源在于 DeepSeek 为缓解长上下文显存压力采用的分块 KV Cache 压缩技术。该技术把连续 Token 按固定长度切块,通过可学习门控层压缩成“小摘要”,但每个 Token 在压缩段内的位置(相位)因此变得关键:排到强势槽位的 Token 被加权保留,排到盲点槽位的几乎被忽略。研究人员还发现注意力头形成相位专门化分工,某些排位天然成为薄弱环节。在 128K Token 的“大海捞针”测试中,DeepSeek-V4-Flash-Base 不同位置间准确率最大差距达 40.2%,Pro 版为 34.8%,后训练优化后仍有 19.1% 和 14.8%。

DeepSeek 在 V4.1-Flash 中把压缩步长从 4 砍半到 2,准确率差距降至 6.1%,但未彻底消除。字节团队用 Qwen3-0.6B 架构从头训练验证,发现所有采用分块压缩的模型都出现周期性准确率波动,全注意力基线则没有。这意味着在“把长文本成本打下来”的潮流中,凡采用分块压缩或稀疏化技术的模型,如开源 Llama 3 系列,都可能存在类似盲区。对用户而言,关键条款若卡在信息盲区,模型可能直接无视并给出相反结论,而错误诱因可能只是几个空白字符,排查难度极高。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:雷锋网*

📎 原始来源:雷锋网
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容