核心要点
低秩假设直觉
参数量对比
与 QLoRA 关系
标准回答
一、先把结论讲清楚
全量微调 7B 模型需更新全部 70 亿参数。LoRA 对选定层(通常 Q/V 投影):W' = W + BA,其中 B∈R^{d×r}, A∈R^{r×k}, r<<d。
二、拆开机制和判断点
优势:可训练参数降 100-1000 倍;checkpoint 只需存 LoRA 权重(MB 级);推理时可合并进原权重无额外延迟。
三、补上例子、边界和取舍
QLoRA 进一步量化基座为 4bit 再训 LoRA,单卡可微调 65B。
面试里可以补一句:LoRA 微调的原理和优势是什么 在大模型场景下通常要同时权衡效果、延迟、成本和安全边界。回答时最好带一个例子,比如上下文过长、幻觉、缓存命中或工具调用失败时,系统应该如何降级和观测。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。
追问
追问 1:rank r 如何选择?
题库专题:本地部署大模型 vs 调用云端大模型 API 各有什么优缺点?如何选择?从 8/16/32 网格搜索验证集;r 越大容量越强但易过拟合、显存越高。常见做法:先小 r 快速试验,按任务难度与数据量上调;注意力层 q/v 往往收益最大。
题库延伸:与本追问相关的专题题 → 本地部署大模型 vs 调用云端大模型 API 各有什么优缺点?如何选择?
追问 2:LoRA 应该加在哪些层?
默认加 attention 的 Wq、Wv(有时 Wk、Wo);MLP 层可选。秩 r 与目标层按验证集调。全连接输出层有时不加 LoRA 以保稳定性。QLoRA 在 4bit 基座上同样适用。
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
