浏览所有已发布的技术文章、生活记录和作品展示
共找到 1 篇文章
文件里明明有低位权重,GPU 也支持 FP8,模型却不能正确计算。原因在于,量化从来不是简单地把 16 bit 改成 8 bit。低位数值只记录了编码结果,尺度、分组、张量布局和计算内核共同决定这些数值代表什么。
量化模型从何成立:从 vLLM 的一次 FP8 故障谈起
3 次阅读