GMAsia
    🇨🇳中國·AI 新聞·2026年10月9日·來源: Tech Node

    字節跳動研究人員找出 DeepSeek 模型長上下文檢索不一致的原因

    字節跳動 Seed 團隊的研究人員發現了一種導致 DeepSeek 模型長上下文檢索不一致的機制。他們的研究發現,分塊 KV 快取壓縮使檢索準確性對資訊在壓縮視窗中的位置敏感,導致不同位置之間的差異高達 40 個百分點。

    Nexa 摘要

    字節跳動 Seed 團隊的研究結果揭示了分塊 KV 快取壓縮所引入的特定限制。這項技術旨在降低大型語言模型的記憶體和注意力成本。儘管效率高,但這種壓縮方法使模型回憶資訊的能力高度依賴於資訊在壓縮片段中的確切位置。這種可變性意味著相同的數據在一個位置可以輕鬆檢索,但在另一個位置則很困難,研究人員將這種模式稱為「相位敏感性」。

    該研究在從頭開始訓練的模型中重現了這種行為,表明這是壓縮技術的固有特性,而非 DeepSeek 模型獨有的問題。研究人員發現,這些模型中不同的注意力組件專門從不同的位置檢索資訊,導致觀察到的不一致性。這種專業化,結合分塊壓縮,解釋了強大的平均基準測試結果如何掩蓋重複出現的檢索弱點。

    這項工作為採用 KV 快取壓縮的模型在長上下文理解方面的一個特定挑戰提供了詳細解釋。這意味著僅憑平均檢索準確性評估模型性能可能會忽略重大的實際限制。對於需要從長上下文中一致且精確地回憶資訊的應用程式,解決這種「相位敏感性」對於更可靠的模型行為至關重要。

    分享這篇文章

    延伸閱讀
    原文報道: Tech Node我們不轉載全文, 閱讀原文 →

    相關文章

    6 則