Skip to content

L02-17 评测:没有评测集的 RAG 等于闭眼开车 ​

全局中心内容:评测集是 RAG 项目最重要的资产,比模型选型重要得多。 全局讲解主线:一个无效争论 → 评测集怎么建 → 四个指标 → LLM-judge → 接入 CI → 常见误区。


P1 · 产出页 ​

中心内容:一份 50~200 条的评测集 + 一个可重复运行的评测脚本。

  • 讲解技巧
    • 开场场景:会议上两个人争论「换成 XX 模型效果更好」,争了半小时没有结论。
    • 结论:没有评测集,所有优化都是在赌。
  • 时长:20s

P2 · 评测集怎么建 ​

中心内容:从真实日志捞问题,人工标注正确答案与出处。

  • 页面内容:评测集结构(question / groundTruth / sourceId / 类型)

  • 讲解技巧

    • 强调「真实」二字:自己编的问题太规整,测不出真实差距。
    • 给规模建议:50 条能开始,200 条有统计意义。
    • 提醒要覆盖类型分布:能答的、该拒答的、需要多跳的、含专有名词的。
  • 时长:6min


P3 · 四个核心指标 ​

中心内容:召回率、MRR、拒答准确率、答案质量分。

  • 页面内容:每个指标的定义与计算方式

  • 讲解技巧

    • 讲清指标分层:召回指标定位「检索问题」,答案质量分定位「生成问题」。两者一起看才能定位瓶颈。
    • 给出诊断口诀:召回低先改切分和检索,召回高但答案差再改 Prompt 和模型。
  • 时长:6min


P4 · LLM-judge ​

中心内容:用模型给答案打分,解决人工评估不可持续的问题。

  • 页面内容:评分 Prompt 模板与 rubric

  • 讲解技巧

    • 讲清可靠性做法:给明确的评分维度和样例,不要问「这个答案好不好」。
    • 提醒要定期人工抽检打分结果,防止 judge 漂移。
  • 时长:5min


P5 · 接入 CI ​

中心内容:每次改切分/换模型/改 Prompt 都跑一遍评测。

  • 页面内容:GitHub Actions 配置;阈值门禁

  • 讲解技巧

    • 这是本节最有行动价值的一页:给学员一个可以直接复制的 workflow。
    • 提醒:评测要跑在固定数据集上,且用固定 temperature,否则结果不可比。
  • 时长:6min


P6 · 回归对比 ​

中心内容:优化前后要并列展示,看整体而不是单个 case。

  • 页面内容:改动前后指标对照表

  • 讲解技巧

    • 强调看整体指标 + 看变差的 case 清单,后者往往能发现意外的回归。
    • 提醒:指标提升不到 2% 时要怀疑是不是噪声,重跑一次。
  • 时长:4min


P7 · 常见误区 ​

中心内容:只测「答得对」、用生成的数据测生成、评测集长期不更新。

  • 讲解技巧
    • 逐条讲危害,尤其是「评测集不更新」——业务变了评测集还停在半年前,等于没测。
  • 时长:4min

P8 · 编码:评测脚本 ​

中心内容:一个能输出结构化报告的评测运行器。

  • 页面内容:EvalRunner;结果写 JSON + 生成 Markdown 报告

  • 讲解技巧

    • 强调输出要可 diff:两次运行的报告能直接对比,比看数字更有用。
  • 时长:5min


P9 · 避坑与小结 ​

中心内容:评测集要跟着业务一起长。

  • 讲解技巧
    • 引出下一节:效果有了,账单怎么办——02-18 成本治理。
  • 时长:2min

讲师备忘 ​

项内容
课前必做准备一份 20 条的示例评测集;准备 CI 配置样例
最容易超时处P3 指标定义,容易讲成论文——给公式和一句话解释即可
学员最常问「多少条够?」答:起步 50,做决策至少 200
现场备用无网络 → 用离线构造的评测集跑本地检索部分