Appearance
L02-04 切分策略:RAG 效果的第一决定因素
全局中心内容:切分损失是不可逆的——切碎了就拼不回来。 全局讲解主线:一组对照数据 → 四种策略对比 → 中文特殊处理 → 可视化对比演示。
P1 · 产出页
中心内容:一个中文结构感知切分器,句子不切断、带重叠、表格保语义。
- 讲解技巧
- 开场就说:这一节是全篇性价比最高的一节。换向量库提升不到 5%,把切分做对能提升 20%+。
- 时长:20s
P2 · 量化对比页
中心内容:固定切分最大的问题是切在句子中间。
页面内容:四种策略的召回率/正确率对照表
讲解技巧
- 用那个「年假」例子:固定切分后片段 A 有「满 1 年不满 5 年」没答案,片段 B 有「每年 5 天」没条件。两个都不完整,检索到任何一个都答不对。
- 这个例子非常直观,一定要现场展示。
时长:4min
P3 · 四种策略对比
中心内容:结构感知 + 递归兜底是推荐组合。
页面内容:固定 / 递归 / 结构感知 / 语义切分
讲解技巧
- 明确推荐「结构感知为主、递归兜底」,理由是有标题层级时按结构切,没有时退回递归。
- 语义切分说明为什么不推荐起步用:慢、需额外模型调用。
时长:3min
P4 · 三条规则
中心内容:重叠是跨片段语义不被切断的关键。
页面内容:标题是天然边界 / 段内按句聚合 / 相邻片段保留重叠
讲解技巧
- 第三条要强调:没有重叠时,跨越边界的问答必然失败。给经验值 10%~15%,并说明超过 20% 会让结果高度重复、降低信息密度。
- 黑板画两个相邻片段,用阴影标出重叠部分。
时长:4min
P5 · 中文特殊处理
中心内容:中文没有空格分词,别套英文逻辑。
页面内容:句末标点切分 / 顿号逗号不是句子边界 / 中英混排分别统计
讲解技巧
- 指出最常见的错误:直接套「按空格切词」,结果整段中文变成一个超长句子,触发硬切。
- 给正则表达式(
(?:[。!?;…])+ 英文句点后跟空格),学员可以直接抄。
时长:4min
P6 · 片段大小参考
中心内容:按文档类型给不同值,并用评测集验证。
页面内容:FAQ 200~400 / 制度 500~800 / 技术 600~1000 / 报告 800~1200
讲解技巧
- 强调不要凭感觉定:这个参数对效果影响很大且因文档而异,必须跑评测集。
- 给一个判断方法:看片段 Token 分布,如果大量片段只有一两句话,说明标点识别有问题。
时长:3min
P7 · 编码:切分器
中心内容:titlePath 是本节最关键的产出。
页面内容:CnSentenceSplitter / StructuralSplitter / build() 里注入 titlePath
讲解技巧
- 讲清 titlePath 的三个用途:提高检索命中、答案里给来源位置、按章节过滤。
- 同时预告避坑点:只存元数据不写进文本,向量化时标题语义就丢了。
时长:6min
P8 · 表格保语义 + 可视化对比
中心内容:每行都重复表头,让每行片段自身完整。
页面内容:splitTable 实现;固定切分 vs 结构感知的输出对比
讲解技巧
- 这个可视化对比是本节的收尾重击:同一段文本两种切分并排打印,差异一目了然。
- 表格那部分讲清核心技巧:每行重复表头,这样检索到任一行都能读懂。
时长:6min
P9 · 避坑与小结
中心内容:改切分要全量重灌,所以先做实验再定。
页面内容:先 20~30 篇做实验 / 重叠 10~15% / titlePath 要写进文本
讲解技巧
- 第一条最重要:不要「先随便切跑起来再说」。重灌要重新 Embedding,是要花钱的。
- 结尾引出:文档有新旧两个版本,怎么保证用新版?——02-07 元数据设计。
时长:2min
讲师备忘
| 项 | 内容 |
|---|---|
| 课前必做 | 准备切分对比的输出样例;准备一份带表格的文档 |
| 最容易超时处 | P7 的切分器实现,代码较长——提前写好,现场只讲关键点 |
| 学员最常问 | 「重叠会不会导致重复检索?」答:会,所以控制在 15% 以内 |
| 现场备用 | 中文标点识别失败 → 现场调正则并展示效果变化 |