核心要点

  • 能按实验跟踪/编排/部署/监控分类列举工具

  • 理解开源 vs 云托管平台差异

  • 知道 LLM 时代工具栈变化(vLLM、Weights & Biases 等)

  • 能说明选型考量(团队规模、云厂商、合规)

简要回答

MLOps 工具链覆盖实验跟踪(MLflow/W&B)、流水线编排(Kubeflow/Airflow)、部署(BentoML/Triton)、数据版本(DVC)与监控(Evidently/Arize)。

标准回答

一、按功能分类

类别 代表工具
实验跟踪 MLflow, Weights & Biases, Neptune
数据版本 DVC, LakeFS, Pachyderm
流水线编排 Kubeflow, Airflow, Metaflow, ZenML
特征存储 Feast, Tecton, Hopsworks
模型注册 MLflow Model Registry, SageMaker Model Registry
训练框架 PyTorch, TensorFlow, Ray Train
推理服务 BentoML, TorchServe, Triton, vLLM
容器编排 Docker, Kubernetes
监控 Prometheus+Grafana, Evidently, WhyLabs

二、云平台

AWS SageMaker、GCP Vertex AI、Azure ML 提供托管一站式。

三、选型建议

小团队从 MLflow + Docker + K8s 起步;大企业评估与现有 DevOps/Git 集成;金融等需审计选支持 lineage 的方案。详见 MLOps 工具生态

面试里要把 MLOps 常用哪些工具与平台 放到训练到上线的链路里说:离线指标只是第一步,还要补特征一致性、版本管理、灰度实验、监控漂移和回滚方案。这样能证明你理解的是生产系统,而不是只会背流程图。

回答思路

  • 【定义】用一句话说清「MLOps 常用哪些工具与平台」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:MLOps 工具生态MLOps 入门。工具:BentoMLPyTorch。术语:MLOpsDVC

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:罗列工具不说场景;把 Jupyter 当成 MLOps 平台;忽视特征商店与模型注册的区别。

追问

追问 1MLflow 解决什么核心问题?

实验参数/指标/artifact 跟踪、模型打包与注册、多阶段部署。开源、易集成,但大规模多租户需额外工程。

追问 2Kubeflow 和 Airflow 如何分工?

Airflow 通用 DAG 调度(ETL、触发训练);Kubeflow 专为 ML 设计(KFP 流水线、Katib 调参、KServe 推理)。常组合:Airflow 编排,Kubeflow 跑训练。

追问 3LLM 时代 MLOps 工具有何变化?

新增 vLLM/TGI 推理、LoRA 适配器管理、prompt/评测版本化、RLHF 流水线、GPU 显存监控。核心仍是版本化、CI/CD、可观测性

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习