Appearance
L03-18 Agent 评测:怎么证明它是变好了还是变差了
全局中心内容:Agent 评测要同时看「结果对不对」和「过程对不对」——过程断言是关键。 全局讲解主线:为什么比 RAG 难 → 四个维度 → 过程断言 → 安全一票否决 → 成本控制 → 接入 CI → 常见误区。
P1 · 产出页
中心内容:一个四维评测框架 + 可重复运行的回归脚本。
- 讲解技巧
- 开场对比:RAG 评测看答案,Agent 评测还要看它怎么做的。
- 举例:答案对了,但它在中间调了一次删除接口——这算通过吗?
- 时长:30s
P2 · 为什么更难
中心内容:路径不唯一、有副作用、成本不可忽略。
- 讲解技巧
- 强调副作用是最本质的区别:评测过程本身可能真的改了数据。
- 因此评测环境必须隔离(Mock 或沙箱)。
- 时长:4min
P3 · 四个维度
中心内容:任务完成度 / 过程正确性 / 效率 / 安全性。
页面内容:四维定义与示例指标
讲解技巧
- 强调「效率」这一维经常被忽略:同样完成任务,用 3 轮和用 15 轮成本差 5 倍。
- 给指标建议:平均轮次、平均成本、平均耗时。
时长:6min
P4 · 过程断言
中心内容:must_call / must_not_call / 参数校验 / 顺序校验。
页面内容:断言示例
讲解技巧
- 这是本节最有价值的方法:
must_not_call(delete*)这类断言能挡住「答案对但行为危险」的情况。 - 提醒要允许等价路径(比如先查 A 或先查 B 都算对),断言写太死会产生大量假失败。
- 这是本节最有价值的方法:
时长:6min
P5 · 安全一票否决
中心内容:安全维度不达标,其他再好也判失败。
- 讲解技巧
- 强调这个设计决策的理由:安全不能加权平均,一次越权就是事故。
- 提醒评测用例里要专门放「诱导越权」的用例。
- 时长:4min
P6 · Mock 与沙箱
中心内容:工具必须可替换成 Mock,否则测不了也太贵。
- 讲解技巧
- 强调 Mock 要能返回多种响应(成功/失败/超时),才能测到分支。
- 提醒:也要保留少量真实环境的冒烟测试,防止 Mock 与真实行为脱节。
- 时长:5min
P7 · 接入 CI
中心内容:改 Prompt / 加工具 / 换模型都要跑回归。
- 讲解技巧
- 给出最低配置:20 条核心用例 + 安全断言 + 成本上限,跑一次几分钟。
- 提醒要固定 temperature 和模型版本,否则结果不可比。
- 时长:5min
P8 · 常见误区
中心内容:只看最终答案、样本太少、没有安全用例、不测失败路径。
- 讲解技巧
- 逐条讲危害,尤其「不测失败路径」——真实环境里工具失败是常态。
- 时长:4min
P9 · 章节小结
中心内容:Agent 篇的核心是把「不可控」变成「可控」。
- 讲解技巧
- 用一句话总结全篇:「Agent 工程 80% 的工作是在做防护,不是在写提示词」。
- 引出下一篇:从单个 Agent 到企业平台——04 篇平台化落地。
- 时长:3min
讲师备忘
| 项 | 内容 |
|---|---|
| 课前必做 | 准备四维评分表;准备过程断言示例 |
| 最容易超时处 | P4 过程断言,容易被追问等价路径如何处理 |
| 学员最常问 | 「多少用例够?」答:核心 20 条进 CI,完整集 100+ 定期跑 |
| 现场备用 | 无真实工具 → 全 Mock 演示评测流程 |