GMAsia
    🇨🇳中国·AI 新闻·2026年10月9日·来源: Tech Node

    字节跳动研究人员找出 DeepSeek 模型长上下文检索不一致的原因

    字节跳动 Seed 团队的研究人员发现了一种导致 DeepSeek 模型长上下文检索不一致的机制。他们的研究发现,分块 KV 缓存压缩使检索准确性对信息在压缩窗口中的位置敏感,导致不同位置之间的差异高达 40 个百分点。

    Nexa 摘要

    字节跳动 Seed 团队的研究结果揭示了分块 KV 缓存压缩所引入的特定限制。这项技术旨在降低大型语言模型的内存和注意力成本。尽管效率高,但这种压缩方法使模型回忆信息的能力高度依赖于信息在压缩片段中的确切位置。这种可变性意味着相同的数据在一个位置可以轻松检索,但在另一个位置则很困难,研究人员将这种模式称为“相位敏感性”。

    该研究在从头开始训练的模型中重现了这种行为,表明这是压缩技术的固有特性,而非 DeepSeek 模型独有的问题。研究人员发现,这些模型中不同的注意力组件专门从不同的位置检索信息,导致观察到的不一致性。这种专业化,结合分块压缩,解释了强大的平均基准测试结果如何掩盖重复出现的检索弱点。

    这项工作为采用 KV 缓存压缩的模型在长上下文理解方面的一个特定挑战提供了详细解释。这意味着仅凭平均检索准确性评估模型性能可能会忽略重大的实际限制。对于需要从长上下文中一致且精确地回忆信息的应用程序,解决这种“相位敏感性”对于更可靠的模型行为至关重要。

    分享这篇文章

    深入了解
    原文报道: Tech Node我们不转载全文, 阅读原文 →

    相关文章

    6 则