BitsAndBytes

BitsAndBytes

量化库

亦作、亦称:bnb

BitsAndBytes 是 Hugging Face 生态广泛使用的 PyTorch 量化库,提供 8bit/4bit 线性层与 NF4 等数据类型,是 QLoRA 微调与本地 4bit 推理的事实标准依赖。

主要功能

Linear8bitLt、Linear4bit 将大模型权重以低精度存储,计算时反量化;NF4(NormalFloat4)针对神经网络权重分布优化量化点。

与 QLoRA

QLoRA 在 4bit 冻结基座上训练 LoRA 适配器,BitsAndBytes 提供底层 4bit 存储与双量化技术,使消费级 GPU 可微调 70B 级模型。

注意点

需 NVIDIA GPU 与兼容 CUDA 版本;部分算子仅支持特定架构。生产推理常结合 vLLM、llama.cpp 等专用引擎。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「量化库」
  • 「QLoRA 常用依赖」
  • 「4 位加载模型的库」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 3 篇文章,帮助深入理解该术语。

  1. 1

    模型压缩技术全景:量化、剪枝与蒸馏的理论与实践

    系统掌握模型压缩的三大核心方法——量化、剪枝和知识蒸馏,理解原理、对比方案、掌握实战技巧,让大模型在资源受限环境中高效运行

  2. 2

    LLM 微调技术全景:LoRA、QLoRA、DPO 与参数高效微调实战

    从全量微调到参数高效微调的系统性进阶。深入解析 LoRA、QLoRA、DPO、ORPO、GAPO 等主流微调技术,对比不同方法的参数量、显存需求、训练效果和适用场景,配以完整的 Python 可运行代码和实战训练脚本,帮助开发者为特定任务定制专属 LLM。

  3. 3

    模型量化与压缩:从 FP32 到 INT4 的完整指南(ML 全场景)

    系统讲解模型量化与压缩的核心技术——从 PTQ/QAT 实战到知识蒸馏与结构化剪枝,涵盖 INT8、INT4 等主流方案在 ML 全场景的应用

外部参考

维基百科:查看「BitsAndBytes」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。