SmoothQuant
SmoothQuant让量化更平滑
SmoothQuant 是 MIT 等提出的 W8A8 量化方法:通过数学等价变换将激活量化难度「平滑」迁移到权重,使 INT8 权重与激活量化在大模型上几乎不损精度,显著降低推理显存与延迟。
核心思想
激活离群值(outlier)使 per-tensor 量化困难。SmoothQuant 引入 per-channel 缩放因子,在数学上等价地压缩激活动态范围、放大权重,使两者均易于 8bit 量化。
部署价值
相比 FP16,W8A8 可接近减半显存并提升 Tensor Core 吞吐。已集成于 TensorRT-LLM、vLLM 等推理栈,适合生产级 INT8 服务。
与其他量化
GPTQ/AWQ 侧重权重量化(W4A16);SmoothQuant 强调权重与激活同时 8bit。可与 KV Cache 量化等正交组合。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「让量化更平滑」
- 「W8A8 量化技巧」
- 「把激活难点转给权重」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级概念高频查看详解 →
什么是 AI Agent?它与大语言模型(LLM)的本质区别是什么?
AI Agent 是以 LLM 为大脑、能感知环境并自主规划、调用工具、多步执行并按反馈迭代以达成目标的系统;LLM 只是无状态的文本输入到输出函数。
- 中级概念查看详解 →
什么是 GPTCache?它如何帮助降低 AI 应用成本?
GPTCache 是面向 LLM 的语义缓存层,把"问题→回答"缓存,新请求先做语义相似度匹配,命中即返回缓存答案,从而省 token、降延迟、扛并发。
- 中级场景查看详解 →
智能工单分类系统中,AI 可参与哪些环节?技术选型思路是什么?
AI 可参与工单的自动分类打标、意图情绪识别、智能路由、相似聚合去重、知识推荐、回复草稿与 SLA 预警等环节。选型上高频固定类别用轻量分类模型、复杂少样本用 LLM,并可混合编排,配人工复核闭环。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「SmoothQuant」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
