核心要点
能说明 ML CI/CD 除代码外还测数据与模型
理解 CI(自动测试)与 CD(自动部署)在 ML 中的扩展
知道 CT(持续训练)作为 ML 特有环节
流水线阶段:能按数据校验、训练、评估、注册、部署和监控的顺序讲清 ML CI/CD 的闭环。
简要回答
ML 的 CI/CD 在代码测试之外加入数据验证、模型评估门禁与自动化部署;数据或代码变更可触发重训与晋级(CI/CD/CT)。
标准回答
一、先给出结论和背景
- 传统 CI/CD:针对代码;ML CI/CD 扩展为:
- CI(Continuous Integration):- 代码:lint、单元测试、特征 transform 测试
- 数据:schema 验证、分布快照对比
- 模型:小数据集 smoke training、metric 回归测试(不低于 baseline)
二、拆开关键步骤和判断点
- CD(Continuous Delivery/Deployment):- 评估通过 → 构建推理镜像 → Staging → 金丝雀 → Production
- 模型 artifact 从 Registry 拉取,非手工拷贝
- CT(Continuous Training):——ML 特有:
- 新数据到达或漂移告警 → 自动触发训练 pipeline
- 新模型 beat 旧模型 → 自动进入 CD 流程
三、补上落地边界和取舍
- 典型 GitHub Actions / GitLab CI 阶段:
lint → data-test → train → evaluate → register → deploy-staging → integration-test → promote - 关键:质量门禁(metric 阈值、公平性)阻断劣质模型上线。详见 MLOps 入门、CI/CD 实践。
面试里要把 机器学习场景下 CI/CD 是什么 放到训练到上线的链路里说:离线指标只是第一步,还要补特征一致性、版本管理、灰度实验、监控漂移和回滚方案。这样能证明你理解的是生产系统,而不是只会背流程图。
回答思路
【定义】用一句话说清「机器学习场景下 CI/CD 是什么?如何实践」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
延伸学习
延伸阅读:CI/CD 实践、MLOps 入门。术语:MLOps、可观测性、Checkpoint。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:CI 只跑 pylint 不验证数据/模型;无门禁自动部署最新 checkpoint;混淆 CI 与夜间 batch 训练。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
