PTQ(训练后量化)
PTQ训练完再压低精度
亦作、亦称:训练后量化 · Post-Training Quantization
训练后量化(Post-Training Quantization,PTQ)是指在模型训练完成之后,无需重新训练即可将权重与激活值从高精度(如 FP16/FP32)压缩到低比特表示(如 INT8、INT4)的一类技术。它是当前大模型高效部署的核心手段之一,在推理速度、显存占用和硬件适配上均有显著收益。
概述
训练后量化(Post-Training Quantization,PTQ)是指在模型训练完成之后,无需重新训练即可将权重与激活值从高精度(如 FP16/FP32)压缩到低比特表示(如 INT8、INT4)的一类技术。它是当前大模型高效部署的核心手段之一,在推理速度、显存占用和硬件适配上均有显著收益。
概念定义
PTQ 解决的核心问题是「训练好的大模型如何低成本部署」。
- 量化:将浮点数映射为整数或低比特浮点,例如 FP16 → INT8 或 INT4
- 训练后:不更新原始模型参数,与需要反向传播的量化感知训练(QAT)相对
- 校准数据:少量无标注样本(通常数百条)用于统计激活分布,指导量化参数的确定
- 量化粒度:可按张量级、通道级或分组级(group-wise)分别设定缩放系数,粒度越细精度损失越小
- 典型目标比特宽:INT8(几乎无损)、INT4(轻微精度损失)、INT3 及以下(需专用算法补偿)
为什么需要 PTQ
大模型参数量动辄数百亿,全精度部署面临显存与带宽双重瓶颈。
- 显存压缩:INT4 量化可将显存占用降至 FP16 的 1/4,使原本需要多卡的模型可在单卡上运行
- 推理加速:低比特整数运算在现代 GPU/NPU 上吞吐量更高,带宽压力也更小
- 部署门槛低:相比 QAT 无需修改训练流程,可直接作用于已训练好的权重文件
- 硬件广泛支持:INT8 被 NVIDIA TensorRT、ONNX Runtime 等主流推理框架原生支持
- 代价是在极低比特(≤4 bit)时精度损失加剧,依赖校准集的质量和量化算法的精细程度
主流算法
早期 PTQ 采用简单的对称/非对称线性量化,LLM 时代出现了基于二阶信息和激活感知的高级方法。
- RTN(Round-to-Nearest):最简单的舍入量化,速度快但在低比特时精度下降明显
- GPTQ(2022,Frantar、Ashkboos、Hoefler、Alistarh,IST Austria):基于近似 Hessian 二阶信息逐列量化权重,同步补偿量化误差,可将 LLM 压缩到 3-4 bit 且精度损失极小,发表于 ICLR 2023
- AWQ(2023,Lin 等,MIT Han Lab):「激活感知权重量化」,约 1% 的显著权重对输出影响最大,通过搜索最优逐通道缩放系数加以保护,量化速度远快于 GPTQ,荣获 MLSys 2024 最佳论文
- SmoothQuant(2022,MIT×NVIDIA):将量化难度从激活转移到权重,使 W8A8 场景可用
- GGUF 格式(llama.cpp):面向 CPU/边缘推理的混合精度格式,结合 PTQ 实现消费级设备部署
发展脉络
PTQ 随深度学习部署需求的演进而不断深化,从 CV 模型走向千亿参数 LLM。
- 2018:Banner 等发表「训练后 4-bit 卷积网络量化」,确立早期系统性 PTQ 研究方向
- 2019:Nagel 等提出权重均衡与偏置校正(Data-Free Quantization),无需校准数据
- 2020:NVIDIA TensorRT INT8 校准 API 规模化落地,INT8 成为 CV 推理标配
- 2022:GPTQ 发布,首次将高质量 PTQ 扩展到百亿参数 LLM;SmoothQuant 解决 LLM 激活量化难题
- 2023:AWQ 提出激活感知思路精度超越 GPTQ;llama.cpp + GGUF 使消费级 GPU/CPU 部署大模型成为现实
- 2024 至今:FP8 量化(NVIDIA H100 原生支持)兴起,PTQ 场景从整数扩展到低精度浮点
PTQ 与 QAT 的对比
两者均是模型量化的主流路径,适用场景不同。
- 成本:PTQ 无需重训,数小时内可完成;QAT 需在训练阶段插入伪量化节点,成本高数十倍
- 精度:QAT 通常在极低比特(2-3 bit)时精度更优;INT8 场景下 PTQ 已可达接近无损
- 灵活性:PTQ 可随时作用于任何已有权重,不依赖训练框架;QAT 需与训练流程深度集成
- 适用场景:快速原型验证、生产快速部署首选 PTQ;对精度要求苛刻的极低比特端侧场景考虑 QAT
- 实践中两者可结合:先 PTQ 快速评估,再对关键层做 QAT 微调
校准数据的作用
校准集(calibration set)是 PTQ 区别于完全数据无关量化的关键要素。
- 用途:前向传播校准集,收集激活值的分布统计(最大值、直方图等),确定量化范围
- 规模:通常 128-512 条样本即可,样本过少导致分布失真,过多带来额外计算但收益递减
- 代表性:校准集与实际推理数据分布越接近,量化后精度损失越小;分布偏移会放大量化误差
- 无校准数据方法:Data-Free PTQ 通过生成合成数据或纯统计手段规避对真实数据的依赖
- 校准数据通常不需要标注,只需覆盖目标任务的输入分布即可
局限性与常见误区
PTQ 在工程实践中存在若干需要关注的边界条件与认知误区。
- 极低比特精度崖壁:低于 4 bit 时绝大多数 PTQ 方法精度显著下降,需引入 GPTQ/AWQ 等高级算法
- 异常激活值:LLM 中存在少量极大激活(outlier),破坏线性量化假设,是量化 LLM 的核心难点
- 硬件算子覆盖:不同硬件对量化格式支持程度不一,INT4 在部分 GPU 上需反量化后计算,抵消部分收益
- 误区——量化即免费午餐:量化只降低存储与带宽,并不减少浮点运算量(FLOPs),对纯计算密集场景收益有限
- 评估复杂性:模型在不同任务上的量化敏感度差异大,单一 benchmark 不能完整反映量化质量
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「训练完再压低精度」
- 「最快的模型压缩方式」
- 「靠校准数据减少误差」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念查看详解 →
模型量化部署(PTQ 与 QAT)如何选择?
PTQ 训练后量化快、无需重训但可能掉点需校准集;QAT 量化感知训练插入伪量化、精度高但成本高。
- 中级概念高频查看详解 →
模型压缩有哪些方法?剪枝、量化、蒸馏如何取舍?
剪枝去冗余权重、量化降数值精度、蒸馏让小模型学软标签,按部署约束权衡。
- 中级概念高频查看详解 →
大模型量化(INT8/INT4)是如何压缩模型的?有什么代价?
量化把 FP16 权重映射到低比特整数,靠 scale/zero-point 还原,显著降显存与带宽,代价是精度损失,需 GPTQ/AWQ 等算法补偿。
- 高级概念查看详解 →
MLOps 生命周期包含哪些关键阶段?
MLOps 生命周期:问题定义 → 数据工程 → 实验/训练 → 评估验证 → 部署 → 监控 → (触发)再训练,形成持续改进闭环。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
- 1
模型量化与压缩:从 FP32 到 INT4 的完整指南(ML 全场景)
系统讲解模型量化与压缩的核心技术——从 PTQ/QAT 实战到知识蒸馏与结构化剪枝,涵盖 INT8、INT4 等主流方案在 ML 全场景的应用
- 2
端侧 AI 技术路线:从 NPU 到 Agent 的完整指南
系统讲解端侧 AI(Edge AI)的完整技术体系——从为什么需要端侧 AI 出发,深入解析 NPU/APU/GPU 三大端侧 AI 处理器架构,对比联发科天玑、高通骁龙、苹果 A/M 系列芯片的 AI 能力差异,探讨端侧模型压缩技术(量化/剪枝/蒸馏/知识蒸馏),并展望端侧 Agent 时代的到来。本文是理解 AI 从云端走向设备端的技术必读。
- 3
LLM 推理优化:量化、剪枝、蒸馏与推理加速实战
系统讲解大语言模型推理优化的四大核心技术——量化(Quantization)、剪枝(Pruning)、知识蒸馏(Knowledge Distillation)和推理引擎加速,覆盖从原理到实战的完整链路
