Appearance
L02-17 评测:没有评测集的 RAG 等于闭眼开车
全局中心内容:评测集是 RAG 项目最重要的资产,比模型选型重要得多。 全局讲解主线:一个无效争论 → 评测集怎么建 → 四个指标 → LLM-judge → 接入 CI → 常见误区。
P1 · 产出页
中心内容:一份 50~200 条的评测集 + 一个可重复运行的评测脚本。
- 讲解技巧
- 开场场景:会议上两个人争论「换成 XX 模型效果更好」,争了半小时没有结论。
- 结论:没有评测集,所有优化都是在赌。
- 时长:20s
P2 · 评测集怎么建
中心内容:从真实日志捞问题,人工标注正确答案与出处。
页面内容:评测集结构(question / groundTruth / sourceId / 类型)
讲解技巧
- 强调「真实」二字:自己编的问题太规整,测不出真实差距。
- 给规模建议:50 条能开始,200 条有统计意义。
- 提醒要覆盖类型分布:能答的、该拒答的、需要多跳的、含专有名词的。
时长:6min
P3 · 四个核心指标
中心内容:召回率、MRR、拒答准确率、答案质量分。
页面内容:每个指标的定义与计算方式
讲解技巧
- 讲清指标分层:召回指标定位「检索问题」,答案质量分定位「生成问题」。两者一起看才能定位瓶颈。
- 给出诊断口诀:召回低先改切分和检索,召回高但答案差再改 Prompt 和模型。
时长:6min
P4 · LLM-judge
中心内容:用模型给答案打分,解决人工评估不可持续的问题。
页面内容:评分 Prompt 模板与 rubric
讲解技巧
- 讲清可靠性做法:给明确的评分维度和样例,不要问「这个答案好不好」。
- 提醒要定期人工抽检打分结果,防止 judge 漂移。
时长:5min
P5 · 接入 CI
中心内容:每次改切分/换模型/改 Prompt 都跑一遍评测。
页面内容:GitHub Actions 配置;阈值门禁
讲解技巧
- 这是本节最有行动价值的一页:给学员一个可以直接复制的 workflow。
- 提醒:评测要跑在固定数据集上,且用固定 temperature,否则结果不可比。
时长:6min
P6 · 回归对比
中心内容:优化前后要并列展示,看整体而不是单个 case。
页面内容:改动前后指标对照表
讲解技巧
- 强调看整体指标 + 看变差的 case 清单,后者往往能发现意外的回归。
- 提醒:指标提升不到 2% 时要怀疑是不是噪声,重跑一次。
时长:4min
P7 · 常见误区
中心内容:只测「答得对」、用生成的数据测生成、评测集长期不更新。
- 讲解技巧
- 逐条讲危害,尤其是「评测集不更新」——业务变了评测集还停在半年前,等于没测。
- 时长:4min
P8 · 编码:评测脚本
中心内容:一个能输出结构化报告的评测运行器。
页面内容:EvalRunner;结果写 JSON + 生成 Markdown 报告
讲解技巧
- 强调输出要可 diff:两次运行的报告能直接对比,比看数字更有用。
时长:5min
P9 · 避坑与小结
中心内容:评测集要跟着业务一起长。
- 讲解技巧
- 引出下一节:效果有了,账单怎么办——02-18 成本治理。
- 时长:2min
讲师备忘
| 项 | 内容 |
|---|---|
| 课前必做 | 准备一份 20 条的示例评测集;准备 CI 配置样例 |
| 最容易超时处 | P3 指标定义,容易讲成论文——给公式和一句话解释即可 |
| 学员最常问 | 「多少条够?」答:起步 50,做决策至少 200 |
| 现场备用 | 无网络 → 用离线构造的评测集跑本地检索部分 |