NVFP4(NVIDIA 4-bit 浮点格式)
NVFP44-bit 浮点,显存减半
亦作、亦称:NVIDIA 4-bit 浮点格式 · NVFP4 · NVIDIA FP4 · 4-bit floating point Blackwell · Blackwell 4-bit
NVFP4 是 NVIDIA Blackwell 的 4-bit 浮点格式(E2M1 + 16 值块共享 FP8 缩放 + tensor 级 FP32 缩放)——相比 FP8 内存压缩约 1.8 倍、推理效率约 2 倍,关键任务精度损失 <1%,DGX Spark 和 GB200 原生支持。
结构:E2M1 + 两级缩放
NVFP4 的数值结构:
- E2M1:1 符号位 + 2 指数位 + 1 尾数位,共 4 bit,可表示约 -6 到 6 的范围(0.0, 0.5, 1.0, 1.5, 2, 3, 4, 6 及负值)
- 块级缩放:每 16 个值共享一个 FP8 E4M3 缩放因子(相比 MXFP4 的 32 值块 + E8M0 缩放,块更小、缩放更精细)
- tensor 级缩放:每 tensor 一个 FP32 缩放因子
两级缩放的设计意图:E4M3 缩放因子支持分数级缩放(相比 E8M0 的纯幂次缩放),MSE 从 0.72 降至 0.08;16 值块比 32 值块更适应局部动态范围变化,减少量化误差。
内存开销:每值约 4.5 bit(4 bit 数据 + 16 值共享的 FP8 缩放均摊)+ tensor 级 FP32 均摊。相比 FP16 内存压缩约 3.5 倍,相比 FP8 压缩约 1.8 倍。
精度:关键任务 <1% 损失
NVIDIA 对 DeepSeek-R1-0528 的 PTQ(Post-Training Quantization)实验:从 FP8 量化到 NVFP4,关键语言建模任务的精度损失 <1%。AIME 2024 数学推理基准上 NVFP4 甚至比 FP8 提升 2%(可能是量化噪声的正则化效应)。
精度损失取决于模型规模、量化 recipe 和工作负载。大模型(70B+)对量化更鲁棒,小模型损失可能更大。Nemotron 3 Super 是更激进的案例——预训练阶段就使用 NVFP4-aware recipe,而非事后量化。
与 INT4 的区别:NVFP4 保留浮点语义(共享指数 + 紧凑尾数),动态范围优于均匀整数量化;Blackwell Tensor Core 原生支持 FP4 矩阵运算,无需像 INT4 那样在计算前反量化。
硬件支持:Blackwell 原生
NVFP4 由 Blackwell 第五代 Tensor Core 原生加速,支持 FP4 矩阵乘法并自动处理微缩放数据的分组、动态缩放和 4-bit 矩阵运算。
支持硬件:
- B200/B300:数据中心 GPU
- GB200/GB300:Grace Blackwell 超级芯片
- DGX Spark(GB10):桌面级 Blackwell 开发系统
软件栈:vLLM、TensorRT-LLM、NVIDIA NIM 均已支持 NVFP4。vLLM 在 GLM-5.2 B300 NVFP4 部署中结合 PD 分离实现 TPOT 从 40ms 降至 17ms(vllm.ai 2026-07-23)。NVIDIA Model Optimizer 提供 NVFP4 量化工具链。
与 MXFP4 的区别:MXFP4 是 OCP 微缩放格式标准的跨厂商版本(32 值块 + E8M0 缩放),NVFP4 是 NVIDIA 专有优化(16 值块 + FP8 E4M3 缩放),后者在 Blackwell 上精度更优但不可移植。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「4-bit 浮点,显存减半」
- 「Blackwell 原生的超低精度格式」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
- 1
LLM 推理优化 2026:从 Prefill-Decode 分离到投机解码的全栈技术指南
2026 年,LLM 推理优化已经从单一的模型量化发展为涵盖架构设计、调度策略、内存管理、硬件协同的全栈工程。本文系统梳理 LLM 推理优化的完整技术图谱:Prefill-Decode 分离架构(PD Separation)、投机解码(Speculative Decoding)、PagedAttention v2、动态批处理、KV Cache 压缩、以及 vLLM/TensorRT-LLM/SGLang 三大推理引擎的深度对比与选型指南。
- 2
NVIDIA RTX Spark:消费级AI芯片架构与Windows AI代理平台全景解读
2026年6月1日,NVIDIA CEO黄仁勋在GTC Taipei/COMPUTEX 2026主题演讲中发布RTX Spark超级芯片——这是NVIDIA时隔十余年再次挑战PC处理器领域,将Blackwell GPU与20核Grace CPU集成于单一SoC,支持128GB统一内存和1 petaflop AI算力。本文系统解读RTX Spark的硬件架构、与微软合作的AI代理平台生态、Windows on Arm战略意义,以及对PC行业格局的深远影响。
外部参考
维基百科:查看「NVFP4」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
