Skip to content

L02-04 切分策略:RAG 效果的第一决定因素 ​

全局中心内容:切分损失是不可逆的——切碎了就拼不回来。 全局讲解主线:一组对照数据 → 四种策略对比 → 中文特殊处理 → 可视化对比演示。


P1 · 产出页 ​

中心内容:一个中文结构感知切分器,句子不切断、带重叠、表格保语义。

  • 讲解技巧
    • 开场就说:这一节是全篇性价比最高的一节。换向量库提升不到 5%,把切分做对能提升 20%+。
  • 时长:20s

P2 · 量化对比页 ​

中心内容:固定切分最大的问题是切在句子中间。

  • 页面内容:四种策略的召回率/正确率对照表

  • 讲解技巧

    • 用那个「年假」例子:固定切分后片段 A 有「满 1 年不满 5 年」没答案,片段 B 有「每年 5 天」没条件。两个都不完整,检索到任何一个都答不对。
    • 这个例子非常直观,一定要现场展示。
  • 时长:4min


P3 · 四种策略对比 ​

中心内容:结构感知 + 递归兜底是推荐组合。

  • 页面内容:固定 / 递归 / 结构感知 / 语义切分

  • 讲解技巧

    • 明确推荐「结构感知为主、递归兜底」,理由是有标题层级时按结构切,没有时退回递归。
    • 语义切分说明为什么不推荐起步用:慢、需额外模型调用。
  • 时长:3min


P4 · 三条规则 ​

中心内容:重叠是跨片段语义不被切断的关键。

  • 页面内容:标题是天然边界 / 段内按句聚合 / 相邻片段保留重叠

  • 讲解技巧

    • 第三条要强调:没有重叠时,跨越边界的问答必然失败。给经验值 10%~15%,并说明超过 20% 会让结果高度重复、降低信息密度。
    • 黑板画两个相邻片段,用阴影标出重叠部分。
  • 时长:4min


P5 · 中文特殊处理 ​

中心内容:中文没有空格分词,别套英文逻辑。

  • 页面内容:句末标点切分 / 顿号逗号不是句子边界 / 中英混排分别统计

  • 讲解技巧

    • 指出最常见的错误:直接套「按空格切词」,结果整段中文变成一个超长句子,触发硬切。
    • 给正则表达式((?:[。!?;…]) + 英文句点后跟空格),学员可以直接抄。
  • 时长:4min


P6 · 片段大小参考 ​

中心内容:按文档类型给不同值,并用评测集验证。

  • 页面内容:FAQ 200~400 / 制度 500~800 / 技术 600~1000 / 报告 800~1200

  • 讲解技巧

    • 强调不要凭感觉定:这个参数对效果影响很大且因文档而异,必须跑评测集。
    • 给一个判断方法:看片段 Token 分布,如果大量片段只有一两句话,说明标点识别有问题。
  • 时长:3min


P7 · 编码:切分器 ​

中心内容:titlePath 是本节最关键的产出。

  • 页面内容:CnSentenceSplitter / StructuralSplitter / build() 里注入 titlePath

  • 讲解技巧

    • 讲清 titlePath 的三个用途:提高检索命中、答案里给来源位置、按章节过滤。
    • 同时预告避坑点:只存元数据不写进文本,向量化时标题语义就丢了。
  • 时长:6min


P8 · 表格保语义 + 可视化对比 ​

中心内容:每行都重复表头,让每行片段自身完整。

  • 页面内容:splitTable 实现;固定切分 vs 结构感知的输出对比

  • 讲解技巧

    • 这个可视化对比是本节的收尾重击:同一段文本两种切分并排打印,差异一目了然。
    • 表格那部分讲清核心技巧:每行重复表头,这样检索到任一行都能读懂。
  • 时长:6min


P9 · 避坑与小结 ​

中心内容:改切分要全量重灌,所以先做实验再定。

  • 页面内容:先 20~30 篇做实验 / 重叠 10~15% / titlePath 要写进文本

  • 讲解技巧

    • 第一条最重要:不要「先随便切跑起来再说」。重灌要重新 Embedding,是要花钱的。
    • 结尾引出:文档有新旧两个版本,怎么保证用新版?——02-07 元数据设计。
  • 时长:2min


讲师备忘 ​

项内容
课前必做准备切分对比的输出样例;准备一份带表格的文档
最容易超时处P7 的切分器实现,代码较长——提前写好,现场只讲关键点
学员最常问「重叠会不会导致重复检索?」答:会,所以控制在 15% 以内
现场备用中文标点识别失败 → 现场调正则并展示效果变化