ThunGuo's Blog
首页文章归档分类标签雅集关于

开源项目学习

开源项目学习笔记

共找到 3 篇文章

Mini-SGLang 导读:一条请求的完整推理链路
1 个月前•Admin•39 分钟
Mini-SGLang 导读:一条请求的完整推理链路

本文以在线推理的端到端请求路径为分析对象。链路始于 HTTP 请求解析,经过进程间通信、请求调度、KV cache 管理、模型前向与采样,终止于增量文本或最终 JSON 响应。Transformer forward 是主要计算阶段,其输入与输出受调度状态、显存页表和张量并行通信共同约束。

SGLang
4
量化模型从何成立:从 vLLM 的一次 FP8 故障谈起
1 个月前•Admin•21 分钟
量化模型从何成立:从 vLLM 的一次 FP8 故障谈起

文件里明明有低位权重,GPU 也支持 FP8,模型却不能正确计算。原因在于,量化从来不是简单地把 16 bit 改成 8 bit。低位数值只记录了编码结果,尺度、分组、张量布局和计算内核共同决定这些数值代表什么。

Quantization
3
LMCache 视角下的 KV Cache:对象模型、数据路径与一致性
1 个月前•Admin•16 分钟
LMCache 视角下的 KV Cache:对象模型、数据路径与一致性

在推理引擎内部,KV Cache 有明确的物理归属:它位于某个设备,由具体的 tensor、block table 和计算 stream 管理。这些信息只在当前进程和当前实例中成立。LMCache 希望把 KV 留到请求结束之后,供其他请求或其他实例复用。原来的物理坐标随进程边界失效,缓存必须重新获得一套稳定的身份和生命周期。

LMCacheKVCache
9

关于

A Starter's Daily Log.

快速链接

  • 首页
  • 文章
  • 归档
  • 雅集
  • 分类
  • 关于

分类

  • 开源项目学习
  • 笔记分享

联系我

ThunGuo