核心要点

  • 能说明 ML CI/CD 除代码外还测数据与模型

  • 理解 CI(自动测试)与 CD(自动部署)在 ML 中的扩展

  • 知道 CT(持续训练)作为 ML 特有环节

  • 流水线阶段:能按数据校验、训练、评估、注册、部署和监控的顺序讲清 ML CI/CD 的闭环。

简要回答

ML 的 CI/CD 在代码测试之外加入数据验证、模型评估门禁与自动化部署;数据或代码变更可触发重训与晋级(CI/CD/CT)。

标准回答

一、先给出结论和背景

  • 传统 CI/CD:针对代码;ML CI/CD 扩展为:
  • CI(Continuous Integration):- 代码:lint、单元测试、特征 transform 测试
  • 数据:schema 验证、分布快照对比
  • 模型:小数据集 smoke training、metric 回归测试(不低于 baseline)

二、拆开关键步骤和判断点

  • CD(Continuous Delivery/Deployment):- 评估通过 → 构建推理镜像 → Staging → 金丝雀 → Production
  • 模型 artifact 从 Registry 拉取,非手工拷贝
  • CT(Continuous Training):——ML 特有:
  • 新数据到达或漂移告警 → 自动触发训练 pipeline
  • 新模型 beat 旧模型 → 自动进入 CD 流程

三、补上落地边界和取舍

  • 典型 GitHub Actions / GitLab CI 阶段lint → data-test → train → evaluate → register → deploy-staging → integration-test → promote
  • 关键:质量门禁(metric 阈值、公平性)阻断劣质模型上线。详见 MLOps 入门CI/CD 实践

面试里要把 机器学习场景下 CI/CD 是什么 放到训练到上线的链路里说:离线指标只是第一步,还要补特征一致性、版本管理、灰度实验、监控漂移和回滚方案。这样能证明你理解的是生产系统,而不是只会背流程图。

回答思路

  • 【定义】用一句话说清「机器学习场景下 CI/CD 是什么?如何实践」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:CI/CD 实践MLOps 入门。术语:MLOps可观测性Checkpoint

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:CI 只跑 pylint 不验证数据/模型;无门禁自动部署最新 checkpoint;混淆 CI 与夜间 batch 训练。

追问

追问 1ML 流水线 CI 跑全量训练是否可行?

通常不可。CI 用 subset/smoke train 验证 pipeline 通;全量训练在 scheduled 或手动 trigger 的 CD/CT job,分层节约算力

追问 2如何测试机器学习代码?

特征函数:固定输入 assert 输出;训练:2 epoch 小数据收敛 smoke;推理:schema 与 latency benchmark;模型质量:golden dataset metric 下界。

追问 3蓝绿部署 vs 金丝雀在 ML 中?

蓝绿:流量一键切换,回滚快;金丝雀:5%→50%→100% 逐步验证线上 metric,适合观察模型真实业务影响。常结合 shadow(新模型只记录不返回)。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习