Server R&D Engineer
Agent 的上下文不必从头到尾保持不变。常规 Prompt Cache 真正要求稳定的,是某个可用缓存断点之前的精确前缀。新消息、工具结果或子 Agent 输出如果只追加在末尾,原有前缀通常仍能复用;若内容被插入、删除、改写或重排,应先找到新旧请求的首个差异 token。这个位置之后的旧 KV 状态,在标准因果 Transformer 中通常不能直接沿用。缓存损失因而主要由“改动发生得多早”决定,而不是由“总共改了多少字”决定。
本文以在线推理的端到端请求路径为分析对象。链路始于 HTTP 请求解析,经过进程间通信、请求调度、KV cache 管理、模型前向与采样,终止于增量文本或最终 JSON 响应。Transformer forward 是主要计算阶段,其输入与输出受调度状态、显存页表和张量并行通信共同约束。
文件里明明有低位权重,GPU 也支持 FP8,模型却不能正确计算。原因在于,量化从来不是简单地把 16 bit 改成 8 bit。低位数值只记录了编码结果,尺度、分组、张量布局和计算内核共同决定这些数值代表什么。
在推理引擎内部,KV Cache 有明确的物理归属:它位于某个设备,由具体的 tensor、block table 和计算 stream 管理。这些信息只在当前进程和当前实例中成立。LMCache 希望把 KV 留到请求结束之后,供其他请求或其他实例复用。原来的物理坐标随进程边界失效,缓存必须重新获得一套稳定的身份和生命周期。
Energy = Milk × coffee²
暂无最新评论