AI Agent 可观测性:如何记录推理、工具调用、失败与成本
做 AI Agent 最怕的不是“它答错了”,而是“它为什么答错,没人知道”。普通服务出问题,你还能看日志、看链路、看指标;Agent 出问题,如果没有记录推理步骤、工具调用、上下文、失败原因和成本,就只能靠猜。
AI Agent 可观测性 的目标不是把所有对话原文都存下来,而是让每一次 Agent Run 都能被复盘:它看到了什么、决定了什么、调了什么工具、哪里失败、花了多少钱、最后为什么给出这个结果。
本文脉络:
- 一、为什么 Agent 比普通服务更需要可观测性
- 二、先区分三件事:日志、指标、Trace
- 三、一次 Agent Run 应该记录成一棵 Trace
- 四、推理过程到底要不要记录
- 五、工具调用怎么记录
- 六、失败要分类,不要只写 error
- 七、成本观测:Token、模型、工具和重试
- 八、质量观测:不要只看成功率
- 九、隐私与安全:可观测性不是全量留存
- 十、落地方案:从最小闭环开始
- 十一、常见问题



