简要回答
API 网关鉴权限流 → 请求队列 → vLLM 连续批处理推理 → 流式 SSE 返回;监控 TTFT、TPOT、GPU 利用率;多副本负载均衡。
标准回答
一、先把结论讲清楚
架构层:Load Balancer → API Gateway(鉴权、限流)→ Inference Worker(vLLM/TGI/SGLang)→ 可选 Router 做多模型路由。
二、拆开机制和判断点
关键优化:Continuous Batching 动态合并请求;PagedAttention 管理 KV;Prefix Caching 共享系统 prompt;量化(AWQ/GPTQ)降显存。
三、补上例子、边界和取舍
SLA 指标:TTFT(首 token 延迟)、TPOT(每 token 时间)、吞吐量 tokens/s。可靠性:超时熔断、降级到小模型、请求排队、多 AZ 部署。
面试里要把 设计一个 LLM 模型推理服务 放到训练到上线的链路里说:离线指标只是第一步,还要补特征一致性、版本管理、灰度实验、监控漂移和回滚方案。这样能证明你理解的是生产系统,而不是只会背流程图。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。
追问
追问 1:Prefill-Decode 分离架构?
Prefill 节点批量大、算力型;Decode 节点重内存带宽与 KV Cache,可独立扩缩容。vLLM、TensorRT-LLM 等支持 PD 分离,按流量特征分别弹性,降低尾延迟与成本。
追问 2:如何做模型 A/B 测试?
流量随机分层到模型 A/B;定义主指标(准确率、转化率)与护栏(延迟、成本、投诉率);样本量与实验周期做功效分析;注意辛普森悖论与新奇效应;灰度发布 + 可回滚。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
