标准回答
一、按功能分类
| 类别 | 代表工具 |
|---|---|
| 实验跟踪 | MLflow, Weights & Biases, Neptune |
| 数据版本 | DVC, LakeFS, Pachyderm |
| 流水线编排 | Kubeflow, Airflow, Metaflow, ZenML |
| 特征存储 | Feast, Tecton, Hopsworks |
| 模型注册 | MLflow Model Registry, SageMaker Model Registry |
| 训练框架 | PyTorch, TensorFlow, Ray Train |
| 推理服务 | BentoML, TorchServe, Triton, vLLM |
| 容器编排 | Docker, Kubernetes |
| 监控 | Prometheus+Grafana, Evidently, WhyLabs |
二、云平台
AWS SageMaker、GCP Vertex AI、Azure ML 提供托管一站式。
三、选型建议
小团队从 MLflow + Docker + K8s 起步;大企业评估与现有 DevOps/Git 集成;金融等需审计选支持 lineage 的方案。详见 MLOps 工具生态。
面试里要把 MLOps 常用哪些工具与平台 放到训练到上线的链路里说:离线指标只是第一步,还要补特征一致性、版本管理、灰度实验、监控漂移和回滚方案。这样能证明你理解的是生产系统,而不是只会背流程图。
回答思路
【定义】用一句话说清「MLOps 常用哪些工具与平台」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:罗列工具不说场景;把 Jupyter 当成 MLOps 平台;忽视特征商店与模型注册的区别。
追问
追问 1:MLflow 解决什么核心问题?
实验参数/指标/artifact 跟踪、模型打包与注册、多阶段部署。开源、易集成,但大规模多租户需额外工程。
追问 2:Kubeflow 和 Airflow 如何分工?
Airflow 通用 DAG 调度(ETL、触发训练);Kubeflow 专为 ML 设计(KFP 流水线、Katib 调参、KServe 推理)。常组合:Airflow 编排,Kubeflow 跑训练。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
