可观测性(Observability)
可观测性知道 AI 系统在干什么
亦作、亦称:Observability
可观测性(Observability)是指通过采集系统运行时产生的日志、指标与追踪数据,从外部推断其内部状态的能力。对于大语言模型应用而言,它是生产环境中诊断问题、控制成本、持续优化的核心基础设施。
概述
可观测性源自控制论,后被工程界引入分布式系统领域,近年随 LLM 应用爆发而成为 AI MLOps 的核心议题。
- 核心问题:生产环境中 LLM 的推理过程是「黑盒」,出错时难以定位根因,可观测性提供了「透视」手段。
- 三大支柱:日志(Log)、指标(Metric)、追踪(Trace),三者协同覆盖系统行为的不同维度。
- 与传统监控的区别:传统监控回答「系统是否正常」,可观测性回答「系统为何表现如此」,侧重可探索性。
- LLM 特殊性:需额外追踪 prompt 内容、token 用量、模型版本、工具调用链等 AI 专属上下文,这是通用 APM 工具不能直接覆盖的。
工作原理
LLM 可观测性的实现依赖在调用链路各节点插入采集探针,将结构化数据上报到集中式后端。
- 日志(Log):记录每次请求的 prompt、补全结果、报错栈及关联元数据,供事后复盘。
- 指标(Metric):汇聚为时序数据,常见字段包括延迟(P50/P95/P99)、Token 消耗量、错误率、每次请求成本。
- 追踪(Trace):以 span 串联多步 Agent 调用链(LLM 调用 → 工具调用 → 检索 → 再调用),还原完整执行路径。
- 采样策略:高并发场景下对全量追踪进行采样(如头部采样或尾部采样),在数据量与完整性之间取得平衡。
- OpenTelemetry:云原生社区推出的开放标准,正逐渐成为 LLM 可观测性数据格式的事实规范,LangChain、LlamaIndex 等框架已内置集成。
类型与工具
LLM 可观测性工具可按职责范围分为两类。
- 通用 APM 扩展:Datadog、Grafana、Prometheus 等主流监控平台增加了 LLM 专属 dashboard 和 trace 视图,适合已有基础设施的团队。
- AI 原生平台:Langfuse、Helicone、Arize Phoenix、Weights & Biases Weave 等专为 LLM 工作流设计,内置 prompt 版本管理、评估打分、成本分析等功能。
- 框架内置集成:LangChain 的 LangSmith、LlamaIndex Tracing 等与开发框架深度绑定,零配置即可获得基础追踪。
- 自建方案:将 OpenTelemetry SDK 植入应用代码,自行选择存储后端(如 Jaeger、ClickHouse),灵活性最高但运维成本也最高。
应用场景
可观测性在 LLM 应用的整个生命周期中持续发挥价值。
- 故障排查:当用户反馈回答质量差或报错时,通过 trace 还原完整调用链,快速定位是 prompt 问题、检索召回问题还是模型问题。
- 成本优化:分析各请求的 Token 消耗分布,识别异常高消耗的 prompt 模板或用户行为,指导提示词精简。
- 性能调优:监控端到端延迟,分解首 Token 延迟(TTFT)与生成延迟(TBT),定向优化瓶颈节点。
- 评估与回归测试:记录生产 prompt 与输出,建立「黄金数据集」,用于离线评估和模型升级后的回归对比。
- 合规与审计:保留完整的输入输出日志,满足金融、医疗等高合规行业对 AI 决策过程的审计需求。
局限与误区
可观测性并非银弹,落地时有几类常见误区。
- 误区:记录越多越好:全量记录 prompt 和完整输出会带来巨大存储成本,且可能违反用户隐私协议(含 PII 的输入需脱敏处理)。
- 误区:有工具就有可观测性:接入工具只是第一步,真正的价值在于建立告警规则、定期分析数据并驱动改进。
- 局限:非结构化输出难以量化:LLM 的自然语言输出质量难以用单一指标度量,需配合专门的 LLM-as-Judge 评估方案。
- 局限:多模型切换增加复杂度:不同模型提供商的 API 格式差异较大,统一追踪方案需额外的适配层。
发展脉络
可观测性概念从控制论走向软件工程,再延伸至 AI 系统,历经数十年演进。
- 1960 年:控制论学者 Rudolf E. Kálmán 在线性动态系统理论中首次正式定义「可观测性」这一数学概念。
- 2010 年:Google 发表 Dapper 论文,奠定大规模分布式追踪的工程基础。
- 2019 年:CNCF 将 OpenCensus 与 OpenTracing 合并为 OpenTelemetry,推动可观测性标准化。
- 2023 年:LLM 应用爆发,Langfuse、Helicone、Arize Phoenix 等 AI 原生可观测性平台相继涌现。
- 2024 年:OpenTelemetry 社区发布 GenAI 语义约定(Semantic Conventions for Generative AI)草案,为 AI 调用链的标准化奠定基础。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「知道 AI 系统在干什么」
- 「落地部署必懂」
- 「跟 可观测性 是一回事吗」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级场景查看详解 →
线上推理延迟突然升高,如何排查?
先按链路分段定位是检索/推理/网络哪段变慢,再查缓存失效、排队/批大小、GC 冷启动、依赖服务与流量突增。
- 高级场景高频查看详解 →
模型离线指标好、线上效果差,如何定位?
首查训练/线上特征是否一致(skew)与标签泄漏,再排数据分布漂移、线上特征延迟缺失与评估集是否代表线上。
- 中级系统设计高频查看详解 →
如何监控线上模型?数据漂移与概念漂移如何检测?
监控分输入漂移(PSI/KS 检测分布变化)与概念漂移(P(y|x) 变、精度掉),叠加在线指标与告警。
- 中级场景查看详解 →
如何对模型做 A/B 测试与灰度发布?
随机分流对比新老模型,设核心+护栏指标,先 canary 小流量验证再逐步放量,异常自动回滚。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「可观测性」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
