简要回答

Agent 可观测性覆盖四大维度:①性能指标(推理延迟、工具调用延迟、端到端任务时间)②成本指标(token 消耗、API 调用成本、模型路由成本分布)③安全指标(异常行为检测、权限越界告警、Prompt Injection 检测)④质量指标(任务完成率、幻觉率、用户满意度)。关键工具:Wattage(token profiler)、Preloop(行为审计)。告警设计需区分"Agent 异常"和"Agent 自主决策",基于行为基线而非固定阈值。

核心要点

  • 四维度指标体系:性能(TTFT/TPS/工具调用延迟/端到端任务时间/循环次数/上下文使用率)、成本(token 消耗/API 调用成本/模型路由分布/成本回归预测)、安全(异常行为/权限越界/Prompt Injection/Rogue Agent 检测)、质量(任务完成率/幻觉率/用户满意度/重试率)

  • Agent 可观测性的特殊性:传统 APM 关注请求-响应模式,Agent 工作流是多步骤、有状态、有副作用的——一个任务可能涉及 10+ 次 LLM 调用、5+ 次工具调用,且 Agent 有自主决策能力

  • 告警分级与行为基线:P0 立即响应(权限越界/数据泄露/成本异常飙升 >10x)、P1 一小时响应(任务失败率上升/幻觉率上升/延迟 SLA 违反)、P2 下一工作日(成本优化建议/工具调用模式变化)。阈值基于行为基线而非固定值

  • 2026 年工具链:Wattage(token 成本分析与回归预测)、Preloop(Agent 行为审计)、OpenTelemetry for Agents标准化追踪)

标准回答

一、Agent 可观测性的特殊性

传统 APM 关注请求-响应模式,但 Agent 工作流是多步骤、有状态、有副作用的:一个任务可能涉及 10+ 次 LLM 调用、5+ 次工具调用、跨多个 API 的操作,且 Agent 有自主决策能力——它可能走一条开发者没预料到的路径完成任务。

二、四维度指标体系

  1. 性能指标:推理延迟(TTFT/TPS)、工具调用延迟、端到端任务时间、循环次数(Loop Engineering 关键指标)、上下文使用率。

  2. 成本指标:Token 消耗(按模型/任务/Agent 分布)、API 调用成本、模型路由成本分布、成本回归预测(Wattage 核心能力)。

  3. 安全指标:异常行为检测(Agent 行为偏离正常模式)、权限越界告警、Prompt Injection 检测、Rogue Agent 检测。

  4. 质量指标:任务完成率、幻觉率、用户满意度、重试率。

三、告警设计与行为基线

核心挑战是区分"Agent 异常"和"Agent 自主决策":

  • P0 告警(立即响应):权限越界、数据泄露、成本异常飙升(>10x 正常值)、Rogue Agent 检测
  • P1 告警(1 小时内响应):任务失败率上升、幻觉率上升、延迟 SLA 违反
  • P2 告警(下一工作日响应):成本优化建议、工具调用模式变化

告警阈值设计需要基于行为基线而非固定阈值——不同 Agent、不同任务的"正常"差异很大。行为基线需要 1-2 周观察期建立并定期更新。

常见误区

⚠️ 常见踩坑

误区一:只用传统 APM 监控 Agent。 忽视 Agent 的多步骤、有状态、有副作用特性,无法捕捉 Agent 自主决策路径。误区二:告警阈值用固定值而非行为基线。 不同 Agent/任务的"正常"差异很大,固定阈值导致大量误报或漏报。误区三:只监控成本不监控安全。 成本超支可以事后优化,安全事件可能造成不可逆损害。

追问

追问 1如何为 Agent 建立行为基线?需要多长的观察期?

行为基线建立分三步:①数据收集——收集 1-2 周的正常运行数据,必须涵盖不同任务类型和负载水平,否则基线会有偏差;②统计建模——统计每个指标的中位数、P95、P99 和标准差,建立正态分布或偏态分布模型;③动态阈值——设置 P99 + 2标准差为告警阈值,低于此阈值的波动视为正常。基线需*定期更新(每月或 Agent 行为模式变化时),避免基线老化导致误报或漏报。

追问 2Wattage token profiler 的成本回归模型是如何工作的?

Wattage 基于历史 token 消耗数据建立成本回归模型:①分组建模——按任务类型、模型、工具调用模式分组,每组独立建立成本模型;②回归预测——使用线性回归或时间序列模型预测未来成本,需至少 100 条历史数据才有统计意义;③偏差告警——当实际成本偏离预测超过阈值时触发告警,帮助团队及时发现成本异常。核心价值是将成本管理从"事后分析"前移到"事前预测"。

追问 3如何在可观测性和 Agent 隐私之间取得平衡?

关键策略:①最小化数据采集——只采集与任务相关的 Agent 行为数据,不采集 Agent "思考过程",减少隐私泄露风险;②数据脱敏——对敏感工具调用参数(如用户个人信息、API 密钥)进行脱敏处理,确保可观测数据不包含敏感信息;③访问控制——可观测性数据仅限安全团队和 Agent 开发者访问,使用 RBAC 控制权限;④数据留存策略——设置合理的数据过期时间(如 30 天),避免长期存储带来的合规风险。

延伸学习

按主题分类的相关资源,便于系统复习