← 返回
可观测与评测:AI 团队的仪表盘
传统系统看 CPU、内存、错误率;AI-Native 团队还要看任务质量、推理成本、上下文命中率、工具调用成功率和评测回归。
1. 必须记录的 Trace
| Trace 字段 |
说明 |
| trace_id |
一次完整任务的全链路 ID |
| agent_id |
哪个 Agent 执行 |
| model |
使用的模型和版本 |
| prompt_version |
提示词版本 |
| tool_calls |
工具名称、参数摘要、结果摘要 |
| token_usage |
输入、输出、缓存、总成本 |
| latency |
每个节点耗时 |
| eval_score |
质量评分或人工验收结果 |
2. 四类指标
| 指标 |
看什么 |
常见问题 |
| 质量 |
正确率、通过率、人工返工率 |
模型换了以后退化 |
| 成本 |
token、工具调用、外部 API |
多 Agent 互相啰嗦 |
| 延迟 |
首响、总耗时、节点耗时 |
编排链过长 |
| 风险 |
拒绝率、人审率、越权尝试 |
权限边界不清 |
3. 评测集
评测集不是算法岗专属,它是 AI 团队架构的回归测试。
建议建立 4 套 eval:
| Eval |
用途 |
| Golden tasks |
典型任务是否稳定完成 |
| Adversarial tasks |
Prompt Injection、越权、恶意输入 |
| Regression tasks |
改 prompt、换模型、换工具后是否退化 |
| Business acceptance |
是否符合真实业务验收标准 |
4. 工具选择
| 工具 |
适合场景 |
| OpenAI Tracing |
使用 Agents SDK 构建时快速查看链路 |
| LangSmith |
LangChain / LangGraph 应用的 trace、dataset、eval |
| Langfuse |
开源 LLM Observability、prompt 管理、eval |
| OpenTelemetry GenAI |
想把 AI trace 接进标准监控体系 |
5. 告警规则
- 任务成功率低于 95%
- 平均成本超过预算线
- 工具调用失败率连续升高
- 人审拒绝率异常升高
- eval 分数低于发布阈值
- 某个 Agent 出现重复循环或无效 handoff
推荐阅读