核心要点

  • 低秩假设直觉

  • 参数量对比

  • 与 QLoRA 关系

简要回答

LoRA 假设权重更新是低秩的,用两个小矩阵 B×A 近似 ΔW,冻结原模型只训 LoRA 权重,省显存且可多任务切换 adapter。

标准回答

一、先把结论讲清楚

全量微调 7B 模型需更新全部 70 亿参数。LoRA 对选定层(通常 Q/V 投影):W' = W + BA,其中 B∈R^{d×r}, A∈R^{r×k}, r<<d。

二、拆开机制和判断点

优势:可训练参数降 100-1000 倍;checkpoint 只需存 LoRA 权重(MB 级);推理时可合并进原权重无额外延迟

三、补上例子、边界和取舍

QLoRA 进一步量化基座为 4bit 再训 LoRA,单卡可微调 65B。

面试里可以补一句:LoRA 微调的原理和优势是什么 在大模型场景下通常要同时权衡效果、延迟、成本和安全边界。回答时最好带一个例子,比如上下文过长、幻觉、缓存命中或工具调用失败时,系统应该如何降级和观测。

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。

追问

追问 1rank r 如何选择?

题库专题:本地部署大模型 vs 调用云端大模型 API 各有什么优缺点?如何选择?

从 8/16/32 网格搜索验证集;r 越大容量越强但易过拟合、显存越高。常见做法:先小 r 快速试验,按任务难度与数据量上调;注意力层 q/v 往往收益最大。

题库延伸:与本追问相关的专题题 → 本地部署大模型 vs 调用云端大模型 API 各有什么优缺点?如何选择?

追问 2LoRA 应该加在哪些层?

默认加 attention 的 Wq、Wv(有时 Wk、Wo);MLP 层可选。秩 r 与目标层按验证集调。全连接输出层有时不加 LoRA 以保稳定性。QLoRA 在 4bit 基座上同样适用。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习