SmoothQuant

SmoothQuant

让量化更平滑

SmoothQuant 是 MIT 等提出的 W8A8 量化方法:通过数学等价变换将激活量化难度「平滑」迁移到权重,使 INT8 权重与激活量化在大模型上几乎不损精度,显著降低推理显存与延迟。

核心思想

激活离群值(outlier)使 per-tensor 量化困难。SmoothQuant 引入 per-channel 缩放因子,在数学上等价地压缩激活动态范围、放大权重,使两者均易于 8bit 量化。

部署价值

相比 FP16,W8A8 可接近减半显存并提升 Tensor Core 吞吐。已集成于 TensorRT-LLM、vLLM 等推理栈,适合生产级 INT8 服务。

与其他量化

GPTQ/AWQ 侧重权重量化(W4A16);SmoothQuant 强调权重与激活同时 8bit。可与 KV Cache 量化等正交组合。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「让量化更平滑」
  • 「W8A8 量化技巧」
  • 「把激活难点转给权重」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    模型压缩技术全景:量化、剪枝与蒸馏的理论与实践

    系统掌握模型压缩的三大核心方法——量化、剪枝和知识蒸馏,理解原理、对比方案、掌握实战技巧,让大模型在资源受限环境中高效运行

  2. 2

    模型量化与压缩:从 FP32 到 INT4 的完整指南(ML 全场景)

    系统讲解模型量化与压缩的核心技术——从 PTQ/QAT 实战到知识蒸馏与结构化剪枝,涵盖 INT8、INT4 等主流方案在 ML 全场景的应用

外部参考

维基百科:查看「SmoothQuant」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。