落地蓝图:从单 Agent 到 AI-Native 团队
这个板块的目标不是讲概念,而是把“AI-Native 团队”落成一套可持续运行的系统。
1. 30 天路线
| 阶段 | 时间 | 目标 | 交付物 |
|---|---|---|---|
| Phase 1 | 1-7 天 | 单 Agent 可完成低风险任务 | role card、tool registry、任务模板 |
| Phase 2 | 8-14 天 | Planner + Builder + Reviewer 协作 | handoff schema、review checklist |
| Phase 3 | 15-21 天 | 加入治理、安全、人审 | permission policy、approval gate |
| Phase 4 | 22-30 天 | 加入 trace、eval、发布节奏 | dashboard、eval set、runbook |
2. 最小可用架构
User Goal
-> Intake Router
-> Planner
-> Worker Agents
-> Reviewer
-> Human Approval
-> Operator
-> Trace + Eval + Knowledge Base
3. 每周验收
| 周 | 验收标准 |
|---|---|
| 第 1 周 | 一个 Agent 能稳定完成 3 类任务,并记录 trace |
| 第 2 周 | 多 Agent 能完成一次带 handoff 的真实任务 |
| 第 3 周 | 高风险动作会自动进入人工审批 |
| 第 4 周 | 有评测集、成本统计、失败复盘模板 |
4. 反模式
- 一个超级 Agent 管所有事。
- Agent 可以直接访问所有工具和密钥。
- 没有任务状态机,只靠聊天上下文。
- 没有 eval,靠感觉判断质量。
- 没有 trace,出了问题只能猜。
- 把外部网页和用户上传内容当成可信指令。
5. 架构师日常
每天看:
- 昨天完成了哪些任务?
- 哪些任务被人审拒绝?
- 哪些工具调用失败?
- 哪些 eval 下降?
- 哪些 prompt 或模型版本需要冻结?
每周做:
- 清理重复 Agent。
- 合并无效工具。
- 补充失败样本到 eval。
- 更新权限策略。
- 写一篇复盘进入知识库。