核心要点
能描述从问题定义到监控的完整生命周期
理解各阶段交付物与门禁
知道迭代闭环(监控触发重训)
能映射到具体工具与实践
简要回答
MLOps 生命周期:问题定义 → 数据工程 → 实验/训练 → 评估验证 → 部署 → 监控 → (触发)再训练,形成持续改进闭环。
标准回答
一、先给出结论和背景
- 问题定义 & 指标:- 业务 KPI → ML 可优化指标(AUC、NDCG、延迟)
- 成功标准与伦理约束
- 数据获取 & 验证:- 采集、清洗、标注;schema/分布验证(Great Expectations)
- 数据版本化(DVC)
- 特征工程:- 特征定义、商店 materialize;train/val/test 划分(时序注意泄漏)
二、拆开关键步骤和判断点
- 实验 & 训练:- 超参搜索、分布式训练;实验跟踪(MLflow)
- 产出 Checkpoint 与评估报告
- 模型验证 & 注册:- 离线指标 + 公平性/鲁棒性测试
- 注册到 Model Registry,晋级 Staging
- 部署:- 容器化、金丝雀/A-B;CI/CD 自动化
三、补上落地边界和取舍
- 监控 & 运维:- 数据漂移、概念漂移、延迟/成本
- 告警 → 根因分析 → 重训或回滚
- 闭环:监控异常触发 CT(Continuous Training)或人工介入。详见 MLOps 入门、模型生命周期。
面试里要把 MLOps 生命周期包含哪些关键阶段 放到训练到上线的链路里说:离线指标只是第一步,还要补特征一致性、版本管理、灰度实验、监控漂移和回滚方案。这样能证明你理解的是生产系统,而不是只会背流程图。
回答思路
【定义】用一句话说清「MLOps 生命周期包含哪些关键阶段」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
延伸学习
延伸阅读:MLOps 入门、模型生命周期、MLOps vs DevOps。术语:MLOps、可观测性。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:生命周期停在「部署」不提监控;各阶段交付物含糊;不说闭环重训。
追问
追问 1:哪个阶段最容易被忽视?
监控与数据验证。模型上线后 silent decay 常见;无漂移检测则数月后业务指标下滑才被发现。应上线首日就接入监控。
追问 2:CRISP-DM 和 MLOps 生命周期关系?
CRISP-DM 是数据挖掘方法论(业务理解→部署);MLOps 在其上加强自动化、版本化、DevOps 集成与持续监控,更适合生产迭代。
追问 3:如何做阶段门禁(quality gate)?
数据:schema 测试通过;训练:metric > baseline;部署:集成测试 + shadow;上线:错误率 < 阈值。未通过则阻断晋级。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
