Appearance
L02-01 RAG 全景:先搞清楚你该不该用 RAG
全局中心内容:离线段决定上限,在线段决定体验。 全局讲解主线:先劝退(四问决策表)→ 再讲链路 → 跑通最小实现 → 验证拒答。
P1 · 产出页
中心内容:这节结束,你能判断某个需求该不该上 RAG。
- 讲解技巧
- 反直觉开场:「这一节不教你怎么建 RAG,教你怎么判断不该建」。先立住专业形象。
- 预告最后会跑通一个最小实现,但强调判断力比实现更重要。
- 时长:20s
P2 · 痛点页:三个真实的翻车
中心内容:把 RAG 当万能药,是所有失败的根因。
页面内容:用 RAG 做格式转换 / 当数据库用 / 文档没整理就上
讲解技巧
- 三条都用「我见过」口吻讲,不要用「你应该注意」。
- 第三条要特别强调:文档里 5 个版本互相矛盾,模型答得随机——根因不在 RAG,在源文档治理。这句话能省掉学员大量无效调参。
时长:3min
P3 · 全链路图
中心内容:离线段决定上限,在线段决定体验。
页面内容:解析 → 切分 → 向量化 → 写库(离线);改写 → 检索 → 重排 → 生成(在线)
讲解技巧
- 黑板只留这一张图,并在「离线/在线」之间画一条粗线。后面每次讲优化都回来指这条线。
- 直接给结论:80% 的效果问题在离线段,因为切碎的语义拼不回来。
时长:4min
P4 · 四问决策表
中心内容:四个都是「是」才值得上完整 RAG。
页面内容:答案在文档里?会变化?需要溯源?超过上下文窗口?
讲解技巧
- 逐条问,让学员自己答。第四问尤其要展开:文档只有几千字时全塞进去效果更好、成本更低、实现更简单。
- 明确说:全塞不是偷懒,在这个量级是更优解。这能纠正「不检索就不专业」的误解。
时长:4min
P5 · 选型表:RAG vs 微调 vs 长上下文
中心内容:要知道什么用 RAG,要怎么说话用微调。
页面内容:知识更新成本、溯源、成本结构、适用场景对比
讲解技巧
- 给口诀:「要知道什么 → RAG;要怎么说话 → 微调;文档又少又固定 → 长上下文」。口诀能记住,表格记不住。
- 诚实说明三者可组合,但起步只做 RAG。
时长:3min
P6 · 编码:最小 RAG
中心内容:QuestionAnswerAdvisor 够用,但不够上生产。
页面内容:PgVectorStore 配置、dimensions 与距离类型、QuestionAnswerAdvisor + topK + threshold
讲解技巧
- 先说清定位:这是验证想法的工具,不是生产方案。然后列出它缺什么(混合检索/重排/引用/拒答/租户过滤),逐条指向 02B 章节。
- 强调
dimensions必须与 Embedding 模型一致,不一致时第一次查询才报错。
时长:6min
P7 · 编码:灌库管道
中心内容:元数据是手工补的,框架不会自动加。
页面内容:解析 → 切分 → 补元数据 → 写入
讲解技巧
- 这句话是本节最值钱的提醒:忘了加 tenantId,后面想做租户隔离只能全量重灌(要重新 Embedding,要花钱)。
- 用一个具体代价说话:80 万片段重灌 = 两周 + 几千元 + 停服。
时长:5min
P8 · 运行与验收
中心内容:拒答测试必须做,它验证 system prompt 是否真的生效。
页面内容:灌库 → 命中提问 → 未命中提问 → 检查回答
讲解技巧
- 现场问一个文档里没有的问题,看系统是不是答「资料中没有」。如果它编了,说明 prompt 没生效——这是学员最容易漏测的一项。
时长:4min
P9 · 避坑与小结
中心内容:先用四问表过滤需求,能砍掉三成伪需求。
页面内容:该不该用要前置判断 / 离线段不可逆 / threshold 用评测集调
讲解技巧
- 第三条给起点值 0.6 并说明必须实测,不要让人以为这是通用值。
- 结尾预告:下一节把「该不该用」变成一棵可执行的决策树。
时长:2min
讲师备忘
| 项 | 内容 |
|---|---|
| 课前必做 | 准备三个翻车案例的具体数字;准备拒答测试的对比输出 |
| 最容易超时处 | P3 全链路图,学员会追问每一段的细节——用「后面每节讲一段」收住 |
| 学员最常问 | 「我们有统计类需求,RAG 能做吗?」答:不能,走 Text-to-SQL,见 02-02 |
| 现场备用 | Docker 起不来 → 用 H2 内存版演示,说明生产换 PG |