微调(Fine-tuning)

微调

在预训练基础上再训练

亦作、亦称:Fine-tuning

微调(Fine-tuning)是迁移学习的核心手段:以预训练模型的权重为起点,在特定任务或领域的数据上继续训练,使通用能力适配垂直场景。相比从头训练,微调所需数据量更少、计算成本更低,已成为大语言模型落地的主流路径。

概述

微调让预训练模型从「通才」变为「专才」,核心思路是用小规模高质量数据继续反向传播,调整模型权重分布。

  • 起点是预训练权重:不从头训练,而是在已收敛的权重上继续,大幅降低数据和算力门槛。
  • 调整行为而非注入知识:微调能改善风格、格式、指令遵从性,但不是可靠的事实知识存储机制。
  • 数据量远小于预训练:预训练往往需要数百 GB 至 TB 级语料,微调通常只需数百至数十万样本。
  • 效果上限受预训练制约:微调无法从根本上弥补预训练阶段完全缺失的能力,只能在已有能力上做精准校准。

工作原理

微调本质是有监督的梯度下降,核心流程如下。

  • 数据格式:最常见为「指令 + 期望回答」的配对文本,即监督微调(SFT,Supervised Fine-Tuning)格式。
  • 损失函数:通常使用交叉熵(cross-entropy)计算模型输出与期望输出的差异,再反向传播更新参数。
  • 学习率要远小于预训练:一般在 1e-5 至 1e-4 量级,过大会导致灾难性遗忘(catastrophic forgetting),覆盖已有通用能力。
  • 进阶对齐:SFT 之后可接 RLHF(基于人类反馈的强化学习)或 DPO(直接偏好优化),使输出更符合人类偏好而非仅拟合文本概率。

发展脉络

微调技术随预训练范式的演进而不断深化。

  • 2012–2017:计算机视觉领域在 ImageNet 预训练模型(VGG、ResNet 等)上微调下游任务成为标准做法,奠定迁移学习基础。
  • 2018ULMFiT(Howard & Ruder)提出区分层学习率与逐层解冻策略,首次在 NLP 中系统论证微调有效性;BERT(Google)将双向 Transformer 预训练与微调结合,在 11 项 NLP 任务上刷新记录。
  • 2019–2020:GPT-2、T5 等大规模模型持续涌现,微调数据集和评测基准(GLUE、SuperGLUE)快速完善。
  • 2021AdapterPrefix Tuning 等参数高效方案兴起;Hu 等人提出 LoRA,以极少额外参数实现接近全量微调的效果,迅速成为工程事实标准。
  • 2023QLoRA 发布,将基础模型量化为 4-bit 后接 LoRA,单张消费级 GPU 可微调 65B 参数模型,大幅降低微调门槛。
  • 2023 至今DPOORPOGRPO 等偏好优化方法成为 RLHF 之外的主流对齐微调方案,简化训练流程。

全量微调与参数高效微调

按参数更新范围,微调分为全量微调和参数高效微调(PEFT)两大类。

  • 全量微调(Full Fine-tuning):更新所有权重,效果上限高,但显存和算力开销与模型参数量同阶,7B 以上规模已相当昂贵。
  • LoRA(Low-Rank Adaptation):在权重矩阵旁插入低秩分解旁路,只训练旁路参数,推理时可合并回原矩阵零额外延迟,目前是工程主流。
  • QLoRA:将基础模型量化为 4-bit 后再做 LoRA,单张消费级 GPU 可微调 13B 乃至更大规模模型。
  • Adapter / Prefix Tuning / Prompt Tuning:在 Transformer 层间插入小型适配模块或在输入端附加可训练前缀,参数量极少,适合多任务切换场景。

与相邻概念的区别

微调常与以下概念混淆,核心差异如下。

  • 微调 vs 提示工程:提示工程不改变权重,依赖模型已有能力;微调会更新权重,适合提示无法稳定解决的行为问题。
  • 微调 vs 预训练:预训练从随机初始化开始,数据量 TB 级;微调在已收敛权重上继续,数据量往往千至百万样本量级。
  • 微调 vs RAG:RAG 将知识存放在外部检索库,模型本身不变,知识可实时更新;微调将行为模式烙入权重,但知识注入效率低。两者并不互斥,「微调 + RAG」是常见生产组合。
  • 微调 vs 蒸馏:蒸馏以大模型输出作为软标签训练小模型,目标是压缩模型;微调目标是适配场景,两者方向不同但可结合使用。

局限与常见误区

微调有几个常见认知误区和工程陷阱。

  • 误区:微调可以可靠灌入新知识:研究和工程实践均表明,通过微调注入大量新事实效果不稳定,模型在未见过的问法上容易产生幻觉,应优先考虑 RAG。
  • 灾难性遗忘:微调数据分布与预训练差异过大时,模型可能丢失原有通用能力,需控制学习率并保留部分通用数据混合训练。
  • 数据质量远比数量重要:几百条高质量标注往往胜过几万条噪声数据,标注一致性和覆盖度是关键。
  • 安全对齐可能被削弱:对开源模型再微调可能绕过原有安全限制,在合规敏感场景中需额外评估。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「在预训练基础上再训练」
  • 「大模型圈高频词」
  • 「跟 微调 是一回事吗」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    LLM 微调技术全景:LoRA、QLoRA、DPO 与参数高效微调实战

    从全量微调到参数高效微调的系统性进阶。深入解析 LoRA、QLoRA、DPO、ORPO、GAPO 等主流微调技术,对比不同方法的参数量、显存需求、训练效果和适用场景,配以完整的 Python 可运行代码和实战训练脚本,帮助开发者为特定任务定制专属 LLM。

  2. 2

    大语言模型预训练:数据准备与训练策略完全指南

    大语言模型预训练的全流程——从数据收集、清洗、去重、Tokenization 到训练策略、学习率调度、分布式训练

外部参考

维基百科:查看「微调」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。