浏览所有已发布的技术文章、生活记录和作品展示
共找到 3 篇文章
本文以在线推理的端到端请求路径为分析对象。链路始于 HTTP 请求解析,经过进程间通信、请求调度、KV cache 管理、模型前向与采样,终止于增量文本或最终 JSON 响应。Transformer forward 是主要计算阶段,其输入与输出受调度状态、显存页表和张量并行通信共同约束。
文件里明明有低位权重,GPU 也支持 FP8,模型却不能正确计算。原因在于,量化从来不是简单地把 16 bit 改成 8 bit。低位数值只记录了编码结果,尺度、分组、张量布局和计算内核共同决定这些数值代表什么。
在推理引擎内部,KV Cache 有明确的物理归属:它位于某个设备,由具体的 tensor、block table 和计算 stream 管理。这些信息只在当前进程和当前实例中成立。LMCache 希望把 KV 留到请求结束之后,供其他请求或其他实例复用。原来的物理坐标随进程边界失效,缓存必须重新获得一套稳定的身份和生命周期。
Mini-SGLang 导读:一条请求的完整推理链路
4 次阅读
量化模型从何成立:从 vLLM 的一次 FP8 故障谈起
3 次阅读
LMCache 视角下的 KV Cache:对象模型、数据路径与一致性
9 次阅读