核心要点

  • 能说明云在算力、存储、托管服务上的价值

  • 理解弹性扩展与按需付费

  • 知道主流云 ML 服务(SageMaker/Vertex/Azure ML)

  • 能讨论多云与数据主权

简要回答

云计算为 MLOps 提供弹性 GPU/TPU、对象存储、托管训练与推理服务,按需扩展且免自建机房,加速实验到生产。

标准回答

一、先给出结论和背景

  • 弹性算力:- 按需启动 GPU/TPU 训练集群,完事即释放
  • Spot/Preemptible 实例降本 60-90%
  • 超参搜索并行数百 job
  • 存储与数据:- S3/GCS 数据湖、版本化、生命周期策略
  • 与 Snowflake/BigQuery 分析仓集成
  • 托管 ML 服务:- AWS SageMaker、GCP Vertex AI、Azure ML
  • 内置实验跟踪、AutoML、模型部署、监控

二、拆开关键步骤和判断点

  • 推理扩展:- Serverless(Lambda/Cloud Run)轻量模型
  • GPU 实例 + 自动扩缩容应对流量峰谷
  • 网络与安全:- VPC 隔离、IAM 细粒度权限、加密 at-rest/in-transit
  • 合规认证(SOC2、HIPAA)减负

三、补上落地边界和取舍

  • MLOps 工具集成:- 云原生 CI/CD(CodePipeline)、容器 registry、K8s 托管(EKS/GKE)
  • 权衡:vendor lock-in、数据出站费用、大训练长时 Spot 中断。混合云:敏感数据 on-prem,burst 训练上云。详见 MLOps 入门

面试里要把 云计算在 MLOps 中起什么作用 放到训练到上线的链路里说:离线指标只是第一步,还要补特征一致性、版本管理、灰度实验、监控漂移和回滚方案。这样能证明你理解的是生产系统,而不是只会背流程图。

回答思路

  • 【定义】用一句话说清「云计算在 MLOps 中起什么作用」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:MLOps 入门AI 工程。术语:MLOpsGPU 集群Checkpoint

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只说「云很方便」不谈成本与 lock-in;忽视数据出站费;不提 Spot 容错需求。

追问

追问 1何时不适合全云 MLOps?

超低延迟本地推理、严格数据主权、长期稳定负载(自建可能更便宜)、气隙环境。可 hybrid:云训练、边缘推理

追问 2云 GPU 成本如何优化?

Spot + checkpoint 容错、right-sizing(别 A100 跑小模型)、自动关机策略、Reserved Instance 稳态负载、量化减推理 GPU。

追问 3SageMaker 和自建 K8s 如何选?

SageMaker 快启 MVP、少运维;K8s 灵活、多云、复杂自定义(多框架、特殊调度)。成熟团队常 K8s + 云算力。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习