核心要点
能定义 DataOps 为数据流水线质量与自动化
理解与 MLOps 的交集与分工
知道数据契约、schema 测试、血缘
能说明「垃圾进垃圾出」对 ML 的影响
简要回答
DataOps 聚焦数据采集、质量、治理与流水线自动化;MLOps 在此基础上覆盖模型训练到 serving——数据质量是 ML 成功的先决条件。
标准回答
一、DataOps
将 DevOps 原则应用于数据流水线——自动化、测试、监控、协作,确保数据可靠、及时、可溯源。
二、核心实践
- 数据契约(Data Contract):上下游约定 schema、SLA、质量指标
- 自动化测试:空值率、分布漂移、唯一性约束
- 血缘(Lineage):追踪字段从源表到特征/模型的路径
- 编排:Airflow/Dagster 调度 ETL,可观测失败重试
三、与 MLOps 关系
下面给出实现示例:
| DataOps | MLOps |
|---|---|
| 数据质量、ETL | 模型训练、部署 |
| Schema 演进 | 模型版本演进 |
| 数据目录 | 模型注册表 |
面试里要把 DataOps 放到训练到上线的链路里说:离线指标只是第一步,还要补特征一致性、版本管理、灰度实验、监控漂移和回滚方案。这样能证明你理解的是生产系统,而不是只会背流程图。
四、协同
MLOps 模型退化时,根因常在数据(上游表变更、采样偏差)——需 DataOps 血缘快速定位。详见 MLOps 入门。
DataOps(数据层)→ Feature Store → MLOps(模型层)→ Serving回答思路
【定义】用一句话说清「什么是 DataOps?它与 MLOps 有何关系」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:DataOps 与 MLOps 完全等同或完全割裂;忽视数据质量对模型的决定性影响。
追问
追问 1:数据契约违反时 ML 流水线应如何反应?
阻断下游训练/推理 job,告警数据负责人;fallback 用上一版本快照(若可用);绝不用坏数据 silent 训练。
追问 2:Feature Store 算 DataOps 还是 MLOps?
桥梁:特征定义偏 DataOps(数据 transform),materialize 到 online store 与 ML serving 集成偏 MLOps。组织上常归 ML Platform 统一管。
追问 3:实时数据质量如何监控?
流式指标(Completeness、Freshness、异常值率)写入时序库;与训练分布对比;超阈触发熔断或降级模型。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
