核心要点

  • 能定义 DataOps 为数据流水线质量与自动化

  • 理解与 MLOps 的交集与分工

  • 知道数据契约、schema 测试、血缘

  • 能说明「垃圾进垃圾出」对 ML 的影响

简要回答

DataOps 聚焦数据采集、质量、治理与流水线自动化;MLOps 在此基础上覆盖模型训练到 serving——数据质量是 ML 成功的先决条件。

标准回答

一、DataOps

将 DevOps 原则应用于数据流水线——自动化、测试、监控、协作,确保数据可靠、及时、可溯源。

二、核心实践

  • 数据契约(Data Contract):上下游约定 schema、SLA、质量指标
  • 自动化测试:空值率、分布漂移、唯一性约束
  • 血缘(Lineage):追踪字段从源表到特征/模型的路径
  • 编排:Airflow/Dagster 调度 ETL,可观测失败重试

三、与 MLOps 关系

下面给出实现示例:

DataOps MLOps
数据质量、ETL 模型训练、部署
Schema 演进 模型版本演进
数据目录 模型注册表

面试里要把 DataOps 放到训练到上线的链路里说:离线指标只是第一步,还要补特征一致性、版本管理、灰度实验、监控漂移和回滚方案。这样能证明你理解的是生产系统,而不是只会背流程图。

四、协同

MLOps 模型退化时,根因常在数据(上游表变更、采样偏差)——需 DataOps 血缘快速定位。详见 MLOps 入门

text
DataOps(数据层)→  Feature Store → MLOps(模型层)→  Serving

回答思路

  • 【定义】用一句话说清「什么是 DataOps?它与 MLOps 有何关系」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:MLOps 入门特征工程。术语:MLOpsDVC可观测性

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:DataOps 与 MLOps 完全等同或完全割裂;忽视数据质量对模型的决定性影响。

追问

追问 1数据契约违反时 ML 流水线应如何反应?

阻断下游训练/推理 job,告警数据负责人;fallback 用上一版本快照(若可用);绝不用坏数据 silent 训练。

追问 2Feature Store 算 DataOps 还是 MLOps?

桥梁:特征定义偏 DataOps(数据 transform),materialize 到 online store 与 ML serving 集成偏 MLOps。组织上常归 ML Platform 统一管。

追问 3实时数据质量如何监控?

流式指标(Completeness、Freshness、异常值率)写入时序库;与训练分布对比;超阈触发熔断或降级模型。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习