核心要点

  • 解释 K-Fold 流程:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。

  • 与单次 hold-out 的对比

  • 注意数据泄漏:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。

简要回答

把数据分成 K 份,每次用 K-1 份训练、1 份验证,轮换 K 次取平均指标,充分利用有限数据且评估更稳定。

标准回答

一、核心回答

单次划分验证集方差大,尤其小数据集。K 折交叉验证 的目的,是用多次轮换评估减少偶然划分带来的波动。

二、关键机制

流程是:1) 随机分 K 折;2) 对 i=1..K,用除第 i 折外的数据训练,第 i 折验证;3) 平均 K 次指标,得到更稳定的泛化估计。

三、面试补充

最容易答漏的是数据泄漏:特征工程标准化、缺失值填充必须在每折训练集内 fit,不能把全量统计量带进验证集。分类任务可用 Stratified K-Fold,时序任务应使用 TimeSeriesSplit。

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。

追问

追问 1什么时候用留一法(LOOCV)?

样本极少(如 n<30)且单次训练成本低时,LOOCV 几乎用尽数据;否则计算量为 n 倍训练,深度模型通常用 k-fold(k=5/10)或 hold-out + 早停。

追问 2交叉验证能用于深度学习吗?

可以但成本高:需训练 k 个模型。小数据集可用 stratified k-fold;大模型常用单次划分 + 验证集早停,或用 nested CV 做超参搜索。注意数据泄漏(先划分再增强/归一化)。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习