这项由独立研究者发表的论文于2026年7月以预印本形式公开,论文编号为arXiv:2607.23693,题为《Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV》,感兴趣的读者可通过该编号查阅完整原文。
当我们谈到人工智能"记忆"的时候,很多人会以为,AI记住某件事,就是把那件事的原始文字存下来,要用的时候再取出来读一遍。这个理解在大多数情况下没问题,但这篇研究告诉我们,真实情况远比这复杂,也远比这神奇——AI有时候在彻底"遗忘"某条原始信息之后,仍然能正确回答依赖那条信息的问题,而且它并没有作弊。这不是魔法,而是大语言模型在处理信息时留下的一种"计算痕迹",这篇研究把这种现象命名为**语义物化**(semantic materialization)。
要理解这个现象,先从一个日常的比喻说起。假设你在一家餐厅工作,你的任务是记录每天的食材状态并转告给同事。某天,你告诉同事小李:"今天的鱼货是新鲜的",小李把这话记在心里,随后又转告了另一位同事小王:"小李说货是新鲜的"。第二天,你忘了最初是你说的这句话,档案室里那张"鱼货新鲜"的记录纸也被销毁了。此时有人来问小王:"今天鱼货新不新鲜?"小王说:"新鲜的。"——他是从哪里知道的?他没有看过原始记录,但这个信息已经通过传话链条"留"在了他的记忆里。
这篇研究要证明的,正是AI系统里存在类似的现象,而且比这个餐厅故事还要精确和可测量。
**一、问题从哪里来:AI的"记忆账本"并不简单**
现代大语言模型在处理长对话或长文档时,会产生一种叫做KV缓存(KV Cache)的数据结构。你可以把它理解成AI在阅读每一段文字时,在大脑里留下的"阅读笔记"——每读一个词或一句话,就在笔记本上写下一些数字,记录它在当前上下文中的含义。
当AI系统需要管理非常长的历史对话时,不可能把所有"阅读笔记"都保留下来,内存不够用。所以系统会有选择地丢弃一部分笔记,只保留它认为重要的那些。这个"丢弃"操作被称为缓存驱逐(eviction)。
问题来了:当你丢掉一页笔记的时候,你真的只是丢掉了那一页纸上的字吗?还是说,那页纸上的内容早已渗透进了后续的笔记里,即使原稿不在了,信息依然还在?
这正是这篇研究要回答的核心问题。研究者认为,现有的AI记忆管理系统在验证"某条记录是否可以安全删除"时,使用的是一个有缺陷的逻辑:如果删掉它之后模型的回答准确率没有下降,就认为这条记录是多余的。但这个逻辑忽视了一种可能性——也许准确率没有下降,不是因为那条记录本来就没用,而是因为它的内容早就被"复制"进了后续某条被保留的记录里。
**二、实验设计:一场极其严格的"信息追踪"游戏**
为了验证这一猜想,研究者设计了一种叫做"捐赠者对"(donor pair)的对比实验。这个设计非常精妙,值得细细说清楚。
研究者构造了一段AI的历史记录,其中包含若干个"事件",比如"S寄存器的状态是在线(ONLINE)"是一个源事件,"M镜像了S的状态"是一个后续的根事件。注意,根事件本身并没有说M是什么状态,它只是说"M跟着S走"。在全量处理(即AI一次性阅读所有历史)之后,根事件所对应的KV缓存行就已经"见过"了源事件,它的数字表示里理论上可能已经包含了"S是在线"这个信息。
然后,研究者在向AI提问时,把源事件的缓存行悄悄删除,只保留根事件的缓存行,然后问AI:"M现在是什么状态?"
关键在于,被提问时AI看到的文字里,完全没有任何地方说M是在线的——源事件被删了,根事件只说"M镜像S",没有任何值。那AI回答"在线"从哪里来的?
为了确保实验结论是可信的,研究者同时构造了一个"孪生"历史版本:除了把源事件改为"S是离线(OFFLINE)"之外,其他所有东西——文字内容、位置、格式——完全一模一样。然后再用同样的方式问AI:"M是什么状态?"
如果AI在第一个版本里回答"在线",在第二个版本里回答"离线",并且两个版本里被实际提供给AI的文字内容完全相同、只有那个被删除的源事件不同,那就说明AI的回答里包含的信息只能来自那个被删除的源事件通过某种方式"留"在了根事件的缓存行里。
**三、震惊的实验结果:99比0**
实验结果非常惊人。在Qwen3-8B这个模型上,研究者跑了99组这样的"对比对",在对AI回答有影响的这些对里,有99组的回答方向跟那个被删除的源事件一致,0组相反。统计学上的p值是3.2×10???,这个数字的意思是,这种结果纯属巧合的概率极其渺茫,相当于你抛了100次硬币,每次都正面朝上。
更进一步的256组复制实验里,130组的回答跟被删除的源事件一致,0组相反,还有125组是两个版本AI给了相同的回答(说明这些问题本身跟那个源事件关系不大)。
这个结果不是特定于某一个模型的。研究者在Ministral-3-8B上跑了类似实验,结果是90比1;在Gemma-4-12B上跑了另一种方式的实验,结果是80比0。换句话说,这个现象在多个不同的AI模型上都成立。
简单来说,一个AI在阅读完整的历史记录之后,它后续生成的某些"笔记"会把早期看到的信息"预先消化"进去。即使你把早期那页原始笔记销毁,那个信息依然以某种形式存在于后续的笔记里,并且在被单独拿出来使用的时候,能够指导AI给出正确的答案。
这就是研究者所定义的"语义物化"——计算过程在下游事件的缓存行里留下了上游信息的印记,而这个印记独立于原始的文字存在。
**四、这个现象的边界在哪里:信息能传递多少**
发现了这个现象之后,研究者没有止步,而是继续追问:这个"隐形传递"能传递多少信息?是什么样的信息都能传,还是有明确的边界?
研究者用一种很直观的方式来测试:把需要传递的信息分成不同"复杂程度"的类别,然后看看每种复杂程度的信息传递成功率。
最简单的是二元状态,也就是"是/否"、"在线/离线"这种只有两个选项的状态。实验结果是这类信息传递的准确率高达0.934,也就是说94%的时候AI能根据那个被删除源事件的内容给出正确答案,而纯靠猜的准确率只有0.5。
接下来是四选一的状态,比如"北/南/东/西"这种有四个选项的情况。准确率直接掉到了0.223,已经非常接近纯猜的准确率(0.25)了。
八选一的情况更糟糕,准确率只有0.156,而随机猜测的准确率是0.125——几乎已经在猜了。
三位数字这种具体的数值?准确率是0,完全没有传递。
这个规律很清晰:缓存行能携带的是粗粒度的状态信号,而不是精确的数值。就像你告诉同事"那道菜辣",同事能记住"辣"这个大方向,但如果你说"那道菜辣度是7.4分",同事大概率只记住"很辣"或者忘了具体数字。
研究者还特别测试了一种情况:如果源事件包含的不是直接的状态值,而是需要计算才能得出的结论,比如"传感器读数超过阈值,警报应该触发"——这种需要推理才能得出的结论,在没有额外提示的情况下,也无法通过缓存行的隐形传递被恢复出来。
研究者把这种现象概括为一个"紧凑状态信封":二元信息能进入这个信封并被传递,更复杂的信息超出了信封的容量。
**五、触发条件:不是所有表达方式都能"写入"这个信封**
发现了这个现象存在之后,研究者开始探究另一个重要问题:哪些表达方式能让这种信息传递发生,哪些不能?
他们设计了16种不同的措辞方式,分成两大家族。一种是镜像表达,比如"M跟随S"、"M镜像S"、"M复制S"、"M影随S"等,描述的语义基本相同,都是"M的状态与S保持一致"。另一种是标志表达,比如"r传感器的警报标志与检测结果一致"、"警报标志根据检测结果更新"等,同样都是描述"某个值跟另一个值保持一致"。
然后研究者测试每种措辞在缓存行上实际"写入"了多少信息——也就是说,当源事件被删除之后,使用这种措辞的根事件,其缓存行能多准确地指导AI回答出正确答案。
结果出人意料。"M跟随S"这种表达方式在Qwen3-8B上的写入率是0.83,而"M与S同步"这种表达方式的写入率只有0.45——两者语义几乎完全相同,但效果相差近一倍。同样,"标志与结果一致"的写入率是0.94,而"标志据结果赋值"只有0.48。
更重要的是,研究者同时测试了AI理解这些表达方式的能力——也就是在提供完整原始信息时,AI能不能正确回答问题。结果是,几乎所有16种表达方式的理解准确率都接近1.0,平均值是0.98。这说明AI完全理解了这些表达,它们在语义上没有任何区别。但理解不等于写入:理解了某个表达方式,不代表在处理这个表达时AI会把相关信息写入后续缓存行。
这就是一个非常反直觉的发现:对AI来说,两种语义完全等价、理解程度完全一样的表达,在信息"物化"进缓存行这个操作上,可以有天壤之别。
不仅如此,这种差异还因模型而异。Qwen3认为"镜像"是个好词(写入率0.80),但Gemma-4对这16种表达的写入率普遍在0.41到0.67之间,没有一种能超过0.75的"强写入"阈值。这意味着在某个模型上有效的表达方式,在另一个模型上不一定有效,需要针对不同模型单独校准。
**六、信息落在哪里:根事件和边缘事件的不同角色**
研究者还探究了一个有趣的问题:在一条"传话链"里,信息究竟落在哪个节点上?
他们构造了这样一条链:S寄存器的值→M镜像S→T镜像M。在这条链上,M是根事件(直接指向源),T是边缘事件(指向根而不是源)。
实验结果显示,当只保留M的缓存行(同时删除S和T的记录)时,AI能以很高的准确率回答M的状态,也能借助M的缓存行回答T的状态,因为T通过M来路由信息。但当只保留T的缓存行(删除S和M的记录)时,AI对T的状态几乎什么都答不出来——准确率跟随机猜测差不多。
这说明边缘事件(T)本身并没有直接"存储"源事件(S)的信息,它只是"知道应该去问M"。当M不在场时,T就失去了这个路由路径,也就说不出正确答案了。
反过来,如果同时保留M和T,然后问T的状态,AI能正确回答,因为T可以通过M找到答案。如果再把M从保留集合里拿掉,只剩T,准确率立刻崩溃。
研究者在Gemma-4-12B上跑这个"有无根事件"的对比,结果是41比0——有根事件时41对问题都给出了正确的方向,没有根事件时几乎什么都不剩(只有2比0,且根事件单独也显示89比0)。
这种现象被研究者概括为"根事件携带信息,边缘事件路由信息"。在设计AI记忆系统时,这意味着哪些缓存行真正值得保留,不是看它们在话题链里的位置离问题最近,而是看它们是否是信息链里真正"落地"的节点。
**七、能不能主动利用这个现象:从"意外发现"到"刻意设计"**
到这里,研究已经确认了一个自然存在的现象。但研究者更进一步,问了一个更有工程价值的问题:既然信息能被"物化"进缓存行,那我们能不能主动设计一个事件,专门用来把信息存储进缓存行里,以备将来使用?
他们把不同的"载体事件"设计成五个级别,从弱到强依次是:被动提及(passive mention,就是自然语言里随便提到了一下某个值),有依据的绑定(grounded binding,明确说某个值跟另一个值绑定),结构化指令(structured directive),自然语言计算指令(NL compute directive,类似于"现在判断结果并记录在这里"),以及最强的显式文字记录(explicit text,直接把答案写出来)。
每种级别对应的"捐赠者对"跟随率如下:被动提及只有6%,有依据的绑定9%,结构化指令23%,自然语言计算指令51%,显式文字记录100%。
这意味着,如果在AI处理历史记录的时候,在源事件之后紧跟着插入一个"请现在推断结论并记录"这样的指令性事件,那么这个事件的缓存行在源事件被删除之后,仍然能让AI以51%的概率给出正确答案,而源事件本身什么都没保留。相比于没有任何刻意设计时的6%,这是一个8倍以上的提升。
这就是研究者所说的"可编程的原语":你可以主动在AI的历史记录里插入特定设计的载体事件,专门用于在源事件被删除后"延续"信息。这对于长期运行的AI代理系统来说,具有实际的工程意义。
不过研究者也诚实地指出了这个方法的局限:最可靠的回退方案仍然是显式文字记录(100%),也就是直接把信息写进文字。自然语言计算指令能做到51%,但这个数字本身仍然意味着近一半的时候它失败了。因此,这种隐性缓存物化更适合作为一种辅助机制,而不是完全替代明确文字记录的主要机制。
**八、在真实对话里有没有用:自然对话的检验结果**
既然刻意设计的载体事件有效,那么在真实的长期对话里,那些自然出现的提及是否也能达到类似的效果?比如在一段持续了21天的对话历史里,早期提到过一件事,中间某个时候又随口提了一下,那么到了对话末尾,只保留"随口提了一下"那次提及的缓存行,能不能帮助AI回答出相关问题?
研究者用了两个真实的长期对话数据集来测试这个问题,一个叫REALTALK,包含了21天的真实对话;另一个叫LoCoMo,是评估AI长期记忆能力的标准测试集。他们把自然对话里那些"随口提及"的事件的缓存行单独提取出来,跟不使用任何历史上下文的孤立编码进行对比,看看使用缓存行的AI是否比重新孤立地读那段文字的AI表现更好。
结果是:没有检测到任何优势。在Qwen3-8B上,用了自然提及缓存行的版本跟孤立编码的版本准确率几乎相同,甚至在LoCoMo数据集上略低(差了0.044)。在Gemma-4-12B上,LoCoMo数据集的结果在统计意义上等同于孤立编码。
这个结果说明:自然对话里那些"随口提及"并不是可靠的信息写入载体。它们可能提及了,但没有触发缓存行里的信息物化。刻意设计的载体事件和自然发生的提及,效果截然不同。
研究者把这个结论表述得非常精确:被动地"收割"自然对话里的提及,不是一个可依赖的信息写入接口。这意味着,任何想利用这个现象设计AI记忆系统的工程师,不能依赖自然对话里随机出现的提及来作为信息载体,必须有意识地插入专门设计的载体事件。
**九、这对"删除不重要的信息"这个操作意味着什么**
研究者在结论部分特别强调了一个对现有AI系统评估实践的重要警示:当一个系统删除了某个"不重要"的记录,然后发现模型的回答准确率没有变化,就认为这个记录确实不重要——这个逻辑是有漏洞的。
因为,系统可能恰好保留了一个在全量处理时见过那个被删除记录的后续缓存行,而这个缓存行里已经"物化"了被删除记录的信息。所以准确率没有下降,不是因为那个被删除的记录原本就没用,而是因为它的信息已经被转移到了别处。如果你在之后再删掉那个后续缓存行,信息才真正消失。
换句话说,"删掉之后准确率不变"只能说明在当前的保留集合下,被删除的记录是冗余的——但它冗余,是因为它的信息已经被下游某个保留的缓存行替代了,而不是因为这个信息本身无关紧要。
这对AI记忆系统的评估方式提出了一个更高的要求:不能仅仅看删除某条记录后准确率是否变化,还需要考虑下游的哪些缓存行可能已经继承了那条记录的信息。
**十、模型之间的差异与通用性问题**
研究者在多个不同的模型上测试了这些现象,并发现了一些有趣的跨模型规律,也发现了一些差异。
Qwen3-8B是研究中测试最完整的模型,表现出了非常清晰的语义物化现象,也对不同的触发措辞表现出了明显的敏感性。Ministral-3-8B也表现出了类似的物化现象,但它的自由生成接口有一个问题:很多时候它会给出冗长的推理过程但不给出明确答案,导致很多实验结果无法判断方向。Gemma-4-12B则表现出了一个很有趣的特点:虽然它在16种触发措辞上的写入率没有任何一种能超过0.75的阈值,但通过另一种"候选逻辑值探测"的方式,可以发现它其实在缓存行里存储了相关信息,只是它的自由生成接口没有把这个信息表达出来。
这种"存储了但说不出来"的现象被研究者称为"理解但未原生生成"的分裂:模型的缓存行里有信息,但在被问到时,它不会主动说出来,除非你用特定的方式问它。
这个发现有一个重要的实践含义:对某个模型有效的触发措辞,不一定对另一个模型有效;在某个模型上能正常读出来的信息,可能在另一个模型上需要用不同的提问方式才能读出来。因此,这整套机制都需要针对具体模型进行校准,没有一种通用的、在所有模型上都有效的方案。
归根结底,这篇研究揭示了一件让人重新思考AI记忆本质的事情:AI处理信息不只是"读了就忘",它在阅读的过程中会把信息"烙印"在后续的计算结果里,而这些烙印即使在原始信息消失之后,有时仍然能够被正确地读取出来。这不是AI在欺骗我们,而是大型语言模型架构的一种内在属性——信息在被处理时,会以某种形式"流淌"到下游的计算节点里。
对于普通用户来说,这可能只是一个有趣的技术细节。但对于正在构建AI代理系统的工程师来说,这意味着他们手里多了一个可以主动设计的工具:通过在合适的时机插入合适措辞的"载体事件",可以让AI在丢失原始记录之后仍然保留关键的状态信息。同时,他们也需要警惕:删除一条记录后准确率不变,不代表那条记录真的没用。
这项研究带来的最大思考是:当我们设计AI的长期记忆时,"保留什么"这个问题,不仅是在选择保留哪些文字,更是在选择保留哪些计算痕迹。而计算痕迹的价值,往往比文字本身的价值更难评估,也更容易被忽视。原论文编号arXiv:2607.23693,希望有兴趣的读者能够深入探索这个领域里还有多少类似的"隐藏规律"等待被发现。
Q&A
Q1:语义物化(semantic materialization)是什么意思?
A:语义物化是指大语言模型在一次完整阅读历史记录的过程中,会把早期信息的计算结果"写入"到后续事件的KV缓存行里。即使后来原始的源事件记录被删除了,那个后续缓存行仍然可能保留着足够的信息,让模型能够正确回答依赖那条被删除信息的问题。简单说,就是"虽然原稿没了,但信息已经渗透进了后续的笔记里"。
Q2:KV缓存驱逐实验里的99比0说明了什么?
A:这个99比0的实验结果说明,在Qwen3-8B模型上,当源事件被删除、只保留根事件的缓存行时,99个"对比对"里有99个的回答方向跟那个被删除的源事件一致,0个相反。由于被提供给模型的文字内容在两个版本里完全相同,这就证明了回答里的信息只能来自被删除源事件通过缓存行留下的"计算痕迹",而不是来自任何可见的文字。
Q3:主动设计"载体事件"来保存AI记忆的方法可靠吗?
A:根据这篇研究的实验结果,使用自然语言计算指令(比如"请现在推断结论并记录")这类刻意设计的载体事件,能把信息的"跟随率"从6%提升到51%。但这仍然意味着接近一半的时候会失败。最可靠的方式仍然是直接用文字把信息明确写出来(100%有效)。因此,这种缓存物化机制更适合作为辅助手段,而不是替代明确文字记录的主要方案,且有效性还会因模型不同而变化,需要针对具体模型进行校准。