核心要点

  • 能描述从问题定义到监控的完整生命周期

  • 理解各阶段交付物与门禁

  • 知道迭代闭环(监控触发重训)

  • 能映射到具体工具与实践

简要回答

MLOps 生命周期:问题定义 → 数据工程 → 实验/训练 → 评估验证 → 部署 → 监控 → (触发)再训练,形成持续改进闭环。

标准回答

一、先给出结论和背景

  • 问题定义 & 指标:- 业务 KPI → ML 可优化指标(AUC、NDCG、延迟
  • 成功标准与伦理约束
  • 数据获取 & 验证:- 采集、清洗、标注;schema/分布验证(Great Expectations
  • 数据版本化(DVC
  • 特征工程:- 特征定义、商店 materialize;train/val/test 划分(时序注意泄漏)

二、拆开关键步骤和判断点

  • 实验 & 训练:- 超参搜索、分布式训练;实验跟踪(MLflow
  • 产出 Checkpoint 与评估报告
  • 模型验证 & 注册:- 离线指标 + 公平性/鲁棒性测试
  • 注册到 Model Registry,晋级 Staging
  • 部署:- 容器化、金丝雀/A-B;CI/CD 自动化

三、补上落地边界和取舍

  • 监控 & 运维:- 数据漂移、概念漂移、延迟/成本
  • 告警 → 根因分析 → 重训或回滚
  • 闭环:监控异常触发 CT(Continuous Training)或人工介入。详见 MLOps 入门模型生命周期

面试里要把 MLOps 生命周期包含哪些关键阶段 放到训练到上线的链路里说:离线指标只是第一步,还要补特征一致性、版本管理、灰度实验、监控漂移和回滚方案。这样能证明你理解的是生产系统,而不是只会背流程图。

回答思路

  • 【定义】用一句话说清「MLOps 生命周期包含哪些关键阶段」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:生命周期停在「部署」不提监控;各阶段交付物含糊;不说闭环重训。

追问

追问 1哪个阶段最容易被忽视?

监控与数据验证。模型上线后 silent decay 常见;无漂移检测则数月后业务指标下滑才被发现。应上线首日就接入监控。

追问 2CRISP-DM 和 MLOps 生命周期关系?

CRISP-DM 是数据挖掘方法论(业务理解→部署);MLOps 在其上加强自动化、版本化、DevOps 集成与持续监控,更适合生产迭代。

追问 3如何做阶段门禁(quality gate)?

数据:schema 测试通过;训练:metric > baseline;部署:集成测试 + shadow;上线:错误率 < 阈值。未通过则阻断晋级。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习