浏览所有已发布的技术文章、生活记录和作品展示
共找到 2 篇文章
Agent 的上下文不必从头到尾保持不变。常规 Prompt Cache 真正要求稳定的,是某个可用缓存断点之前的精确前缀。新消息、工具结果或子 Agent 输出如果只追加在末尾,原有前缀通常仍能复用;若内容被插入、删除、改写或重排,应先找到新旧请求的首个差异 token。这个位置之后的旧 KV 状态,在标准因果 Transformer 中通常不能直接沿用。缓存损失因而主要由“改动发生得多早”决定,而不是由“总共改了多少字”决定。
在推理引擎内部,KV Cache 有明确的物理归属:它位于某个设备,由具体的 tensor、block table 和计算 stream 管理。这些信息只在当前进程和当前实例中成立。LMCache 希望把 KV 留到请求结束之后,供其他请求或其他实例复用。原来的物理坐标随进程边界失效,缓存必须重新获得一套稳定的身份和生命周期。
Agent 上下文变动如何影响 KV Cache 与 Prompt Cache
5 次阅读
LMCache 视角下的 KV Cache:对象模型、数据路径与一致性
9 次阅读