微调(Fine-tuning)
微调在预训练基础上再训练
亦作、亦称:Fine-tuning
微调(Fine-tuning)是迁移学习的核心手段:以预训练模型的权重为起点,在特定任务或领域的数据上继续训练,使通用能力适配垂直场景。相比从头训练,微调所需数据量更少、计算成本更低,已成为大语言模型落地的主流路径。
概述
微调让预训练模型从「通才」变为「专才」,核心思路是用小规模高质量数据继续反向传播,调整模型权重分布。
- 起点是预训练权重:不从头训练,而是在已收敛的权重上继续,大幅降低数据和算力门槛。
- 调整行为而非注入知识:微调能改善风格、格式、指令遵从性,但不是可靠的事实知识存储机制。
- 数据量远小于预训练:预训练往往需要数百 GB 至 TB 级语料,微调通常只需数百至数十万样本。
- 效果上限受预训练制约:微调无法从根本上弥补预训练阶段完全缺失的能力,只能在已有能力上做精准校准。
工作原理
微调本质是有监督的梯度下降,核心流程如下。
- 数据格式:最常见为「指令 + 期望回答」的配对文本,即监督微调(SFT,Supervised Fine-Tuning)格式。
- 损失函数:通常使用交叉熵(cross-entropy)计算模型输出与期望输出的差异,再反向传播更新参数。
- 学习率要远小于预训练:一般在 1e-5 至 1e-4 量级,过大会导致灾难性遗忘(catastrophic forgetting),覆盖已有通用能力。
- 进阶对齐:SFT 之后可接 RLHF(基于人类反馈的强化学习)或 DPO(直接偏好优化),使输出更符合人类偏好而非仅拟合文本概率。
发展脉络
微调技术随预训练范式的演进而不断深化。
- 2012–2017:计算机视觉领域在 ImageNet 预训练模型(VGG、ResNet 等)上微调下游任务成为标准做法,奠定迁移学习基础。
- 2018:ULMFiT(Howard & Ruder)提出区分层学习率与逐层解冻策略,首次在 NLP 中系统论证微调有效性;BERT(Google)将双向 Transformer 预训练与微调结合,在 11 项 NLP 任务上刷新记录。
- 2019–2020:GPT-2、T5 等大规模模型持续涌现,微调数据集和评测基准(GLUE、SuperGLUE)快速完善。
- 2021:Adapter、Prefix Tuning 等参数高效方案兴起;Hu 等人提出 LoRA,以极少额外参数实现接近全量微调的效果,迅速成为工程事实标准。
- 2023:QLoRA 发布,将基础模型量化为 4-bit 后接 LoRA,单张消费级 GPU 可微调 65B 参数模型,大幅降低微调门槛。
- 2023 至今:DPO、ORPO、GRPO 等偏好优化方法成为 RLHF 之外的主流对齐微调方案,简化训练流程。
全量微调与参数高效微调
按参数更新范围,微调分为全量微调和参数高效微调(PEFT)两大类。
- 全量微调(Full Fine-tuning):更新所有权重,效果上限高,但显存和算力开销与模型参数量同阶,7B 以上规模已相当昂贵。
- LoRA(Low-Rank Adaptation):在权重矩阵旁插入低秩分解旁路,只训练旁路参数,推理时可合并回原矩阵零额外延迟,目前是工程主流。
- QLoRA:将基础模型量化为 4-bit 后再做 LoRA,单张消费级 GPU 可微调 13B 乃至更大规模模型。
- Adapter / Prefix Tuning / Prompt Tuning:在 Transformer 层间插入小型适配模块或在输入端附加可训练前缀,参数量极少,适合多任务切换场景。
与相邻概念的区别
微调常与以下概念混淆,核心差异如下。
- 微调 vs 提示工程:提示工程不改变权重,依赖模型已有能力;微调会更新权重,适合提示无法稳定解决的行为问题。
- 微调 vs 预训练:预训练从随机初始化开始,数据量 TB 级;微调在已收敛权重上继续,数据量往往千至百万样本量级。
- 微调 vs RAG:RAG 将知识存放在外部检索库,模型本身不变,知识可实时更新;微调将行为模式烙入权重,但知识注入效率低。两者并不互斥,「微调 + RAG」是常见生产组合。
- 微调 vs 蒸馏:蒸馏以大模型输出作为软标签训练小模型,目标是压缩模型;微调目标是适配场景,两者方向不同但可结合使用。
局限与常见误区
微调有几个常见认知误区和工程陷阱。
- 误区:微调可以可靠灌入新知识:研究和工程实践均表明,通过微调注入大量新事实效果不稳定,模型在未见过的问法上容易产生幻觉,应优先考虑 RAG。
- 灾难性遗忘:微调数据分布与预训练差异过大时,模型可能丢失原有通用能力,需控制学习率并保留部分通用数据混合训练。
- 数据质量远比数量重要:几百条高质量标注往往胜过几万条噪声数据,标注一致性和覆盖度是关键。
- 安全对齐可能被削弱:对开源模型再微调可能绕过原有安全限制,在合规敏感场景中需额外评估。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「在预训练基础上再训练」
- 「大模型圈高频词」
- 「跟 微调 是一回事吗」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级概念高频查看详解 →
对初学者来说,提示工程和微调有什么区别?
提示工程改输入引导模型、不改权重、零成本快;微调用数据再训、改模型权重,适合稳定专有能力/风格。
- 中级概念高频查看详解 →
参数高效微调(PEFT)有哪些主流方法?
PEFT 冻结基座只训练少量参数,主流方法含 LoRA/QLoRA、Adapter、Prefix-Tuning、P-Tuning、(IA)³。
- 高级概念高频查看详解 →
QLoRA 相比 LoRA 有哪些关键改进?
QLoRA = 4-bit NF4 量化基座 + LoRA 适配器 + 双量化 + 分页优化器,单卡即可微调大模型。
- 中级概念高频查看详解 →
LoRA 微调的原理和优势是什么?
在冻结权重旁路加低秩矩阵 ΔW=BA,只训练少量参数,显著降低显存与存储,效果接近全量微调。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「微调」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
