可观测与评测:AI 团队的仪表盘

← 返回


可观测与评测:AI 团队的仪表盘

传统系统看 CPU、内存、错误率;AI-Native 团队还要看任务质量、推理成本、上下文命中率、工具调用成功率和评测回归。

1. 必须记录的 Trace

Trace 字段 说明
trace_id 一次完整任务的全链路 ID
agent_id 哪个 Agent 执行
model 使用的模型和版本
prompt_version 提示词版本
tool_calls 工具名称、参数摘要、结果摘要
token_usage 输入、输出、缓存、总成本
latency 每个节点耗时
eval_score 质量评分或人工验收结果

2. 四类指标

指标 看什么 常见问题
质量 正确率、通过率、人工返工率 模型换了以后退化
成本 token、工具调用、外部 API 多 Agent 互相啰嗦
延迟 首响、总耗时、节点耗时 编排链过长
风险 拒绝率、人审率、越权尝试 权限边界不清

3. 评测集

评测集不是算法岗专属,它是 AI 团队架构的回归测试。

建议建立 4 套 eval:

Eval 用途
Golden tasks 典型任务是否稳定完成
Adversarial tasks Prompt Injection、越权、恶意输入
Regression tasks 改 prompt、换模型、换工具后是否退化
Business acceptance 是否符合真实业务验收标准

4. 工具选择

工具 适合场景
OpenAI Tracing 使用 Agents SDK 构建时快速查看链路
LangSmith LangChain / LangGraph 应用的 trace、dataset、eval
Langfuse 开源 LLM Observability、prompt 管理、eval
OpenTelemetry GenAI 想把 AI trace 接进标准监控体系

5. 告警规则

推荐阅读