# Agent 上线验收清单

路灯 · 配套阅读：https://robinzhu.top/guides/agent/
用途：将 Agent 的任务、行为与环境状态转化为验收条件。本清单是可填写模板，不是自动评测工具。

## 任务边界

- [ ] 用可观察的环境状态定义“完成”，不只看 Agent 的口头回答。
- [ ] 列出允许调用与禁止调用的工具、数据范围和操作对象。
- [ ] 明确必须确认、转人工和终止任务的条件。
- [ ] 把权限、金额、事务与幂等检查放进确定性的代码。

任务：____　成功状态：____　禁止状态：____

## 可复现测试

- [ ] 固定初始数据、模型、提示词、工具 schema 和运行参数。
- [ ] 保留工具参数、返回值、权限检查与状态变更记录。
- [ ] 对核心任务重复运行，记录通过次数与总次数。
- [ ] 覆盖超时、限流、权限拒绝、空结果与重复请求。
- [ ] 验证不可信网页、文档或工具输出中的指令不会获得额外权限。
- [ ] 对关键约束使用程序断言；语义评分保留人工抽查。

样本集版本：____　运行配置：____　断言与结果：____

## 代价与恢复

- [ ] 设置工具调用数、时间和成本预算，并说明阈值依据。
- [ ] 限制重试次数，验证幂等性及停止条件。
- [ ] 验证部分成功后如何补偿、回滚或转人工。
- [ ] 检查跨账户、跨租户访问与敏感信息脱敏。

预算：____　故障演练结果：____

## 上线后的反馈

- [ ] 收集失败、人工接管和异常成本样本，明确保存范围。
- [ ] 将确认的问题纳入回归集，并关联修复版本。
- [ ] 记录告警负责人、停用入口和恢复条件。

结论：____　阻塞项：____　负责人：____　日期：____
