Skip to content

L03-18 Agent 评测:怎么证明它是变好了还是变差了 ​

全局中心内容:Agent 评测要同时看「结果对不对」和「过程对不对」——过程断言是关键。 全局讲解主线:为什么比 RAG 难 → 四个维度 → 过程断言 → 安全一票否决 → 成本控制 → 接入 CI → 常见误区。


P1 · 产出页 ​

中心内容:一个四维评测框架 + 可重复运行的回归脚本。

  • 讲解技巧
    • 开场对比:RAG 评测看答案,Agent 评测还要看它怎么做的。
    • 举例:答案对了,但它在中间调了一次删除接口——这算通过吗?
  • 时长:30s

P2 · 为什么更难 ​

中心内容:路径不唯一、有副作用、成本不可忽略。

  • 讲解技巧
    • 强调副作用是最本质的区别:评测过程本身可能真的改了数据。
    • 因此评测环境必须隔离(Mock 或沙箱)。
  • 时长:4min

P3 · 四个维度 ​

中心内容:任务完成度 / 过程正确性 / 效率 / 安全性。

  • 页面内容:四维定义与示例指标

  • 讲解技巧

    • 强调「效率」这一维经常被忽略:同样完成任务,用 3 轮和用 15 轮成本差 5 倍。
    • 给指标建议:平均轮次、平均成本、平均耗时。
  • 时长:6min


P4 · 过程断言 ​

中心内容:must_call / must_not_call / 参数校验 / 顺序校验。

  • 页面内容:断言示例

  • 讲解技巧

    • 这是本节最有价值的方法:must_not_call(delete*) 这类断言能挡住「答案对但行为危险」的情况。
    • 提醒要允许等价路径(比如先查 A 或先查 B 都算对),断言写太死会产生大量假失败。
  • 时长:6min


P5 · 安全一票否决 ​

中心内容:安全维度不达标,其他再好也判失败。

  • 讲解技巧
    • 强调这个设计决策的理由:安全不能加权平均,一次越权就是事故。
    • 提醒评测用例里要专门放「诱导越权」的用例。
  • 时长:4min

P6 · Mock 与沙箱 ​

中心内容:工具必须可替换成 Mock,否则测不了也太贵。

  • 讲解技巧
    • 强调 Mock 要能返回多种响应(成功/失败/超时),才能测到分支。
    • 提醒:也要保留少量真实环境的冒烟测试,防止 Mock 与真实行为脱节。
  • 时长:5min

P7 · 接入 CI ​

中心内容:改 Prompt / 加工具 / 换模型都要跑回归。

  • 讲解技巧
    • 给出最低配置:20 条核心用例 + 安全断言 + 成本上限,跑一次几分钟。
    • 提醒要固定 temperature 和模型版本,否则结果不可比。
  • 时长:5min

P8 · 常见误区 ​

中心内容:只看最终答案、样本太少、没有安全用例、不测失败路径。

  • 讲解技巧
    • 逐条讲危害,尤其「不测失败路径」——真实环境里工具失败是常态。
  • 时长:4min

P9 · 章节小结 ​

中心内容:Agent 篇的核心是把「不可控」变成「可控」。

  • 讲解技巧
    • 用一句话总结全篇:「Agent 工程 80% 的工作是在做防护,不是在写提示词」。
    • 引出下一篇:从单个 Agent 到企业平台——04 篇平台化落地。
  • 时长:3min

讲师备忘 ​

项内容
课前必做准备四维评分表;准备过程断言示例
最容易超时处P4 过程断言,容易被追问等价路径如何处理
学员最常问「多少用例够?」答:核心 20 条进 CI,完整集 100+ 定期跑
现场备用无真实工具 → 全 Mock 演示评测流程