核心要点

简要回答

API 网关鉴权限流 → 请求队列 → vLLM 连续批处理推理 → 流式 SSE 返回;监控 TTFT、TPOT、GPU 利用率;多副本负载均衡。

标准回答

一、先把结论讲清楚

架构层:Load Balancer → API Gateway(鉴权、限流)→ Inference Worker(vLLM/TGI/SGLang)→ 可选 Router 做多模型路由。

二、拆开机制和判断点

关键优化:Continuous Batching 动态合并请求;PagedAttention 管理 KV;Prefix Caching 共享系统 prompt量化(AWQ/GPTQ)降显存。

三、补上例子、边界和取舍

SLA 指标:TTFT(首 token 延迟)、TPOT(每 token 时间)、吞吐量 tokens/s。可靠性:超时熔断、降级到小模型、请求排队、多 AZ 部署。

面试里要把 设计一个 LLM 模型推理服务 放到训练到上线的链路里说:离线指标只是第一步,还要补特征一致性、版本管理、灰度实验、监控漂移和回滚方案。这样能证明你理解的是生产系统,而不是只会背流程图。

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。

追问

追问 1Prefill-Decode 分离架构?

Prefill 节点批量大、算力型;Decode 节点重内存带宽与 KV Cache,可独立扩缩容。vLLM、TensorRT-LLM 等支持 PD 分离,按流量特征分别弹性,降低尾延迟与成本。

追问 2如何做模型 A/B 测试?

流量随机分层到模型 A/B;定义主指标(准确率、转化率)与护栏(延迟、成本、投诉率);样本量与实验周期做功效分析;注意辛普森悖论与新奇效应;灰度发布 + 可回滚。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习