Appearance
L02-02 选型决策树:RAG、微调、长上下文、Agent 怎么选
全局中心内容:把需求拆开,每个子任务往往有更便宜的解法。 全局讲解主线:争论的根源是没拆任务 → 给决策树 → 成本对比 → 做出路由器。
P1 · 产出页
中心内容:拿到需求,5 分钟判断该走哪条路。
- 讲解技巧
- 直接说:「这节给你一棵树和一张成本表,以后团队再争论选型,拿出来对着走」。
- 时长:20s
P2 · 痛点页:三种人三种答案
中心内容:争论的根源是没把需求拆开。
页面内容:算法出身选微调 / 工程出身选 RAG / 产品说都能做
讲解技巧
- 现场拆一个真实需求:「分析上季度华东区销售额下滑原因,并生成汇报材料」。拆完发现四个子任务、四种解法、没有一种是微调。
- 这个演示是本节的转折点,一定要做。
时长:3min
P3 · 决策树
中心内容:按「数据是否实时」和「文档是否变化」分叉。
页面内容:实时数据 → 工具/SQL;文档会变 → RAG;改变风格 → prompt;多步决策 → Agent
讲解技巧
- 黑板画这棵树,不要放 PPT 上逐条念。画的过程就是讲解过程。
- 强调最后一个分支(微调)是「最后考虑」,不是并列选项。
时长:4min
P4 · 成本对比表
中心内容:微调和长上下文看着简单,实际总成本更高。
页面内容:一次性投入、每次调用成本、更新知识成本、上线周期
讲解技巧
- 两个反直觉结论要讲透:① 微调贵在一次性投入和更新,不在推理;② 长上下文的成本随用量线性增长,容易被忽略。
- 给一个算例:日活几千之后,长上下文方案三个月成本超过 RAG 方案。
时长:4min
P5 · 组合策略:真实项目长什么样
中心内容:不是一个技术打天下,是按子任务分派。
页面内容:意图识别用轻量模型 / 查数据用 SQL / 查文档用 RAG / 推理用旗舰 / 输出用结构化
讲解技巧
- 这张表是本节的交付物,建议学员截图保存。说明它会在 04-02 模型网关里做成可配置路由。
- 点出关键:分派逻辑比单个技术更重要。
时长:3min
P6 · 编码:意图分类器
中心内容:分类用轻量模型就够了,别用旗舰。
页面内容:BeanOutputConverter + temperature 0 + maxTokens 50
讲解技巧
- 强调成本对比:分类输出只有几个 Token,用旗舰模型纯属浪费。这一层成本通常是主流程的 1/20。
- 展示
maxTokens(50)这个细节:既省钱又防止模型开始回答问题。
时长:5min
P7 · 编码:路由分发
中心内容:路由结果必须打日志,否则等于没有路由。
页面内容:switch 分发到 RAG / SQL / AGENT / DIRECT
讲解技巧
- 讲一个排查场景:上线后发现大量本该走 SQL 的问题走了 RAG,靠日志才发现。这些日志就是优化依据。
- 现场演示一次错误路由,看日志怎么暴露问题。
时长:5min
P8 · 验证与小结
中心内容:分类准确率不要求 100%,但下游必须有兜底。
页面内容:四类各 3 个样例;准确率 ≥ 8/12;日志完整
讲解技巧
- 明确说「追求 100% 分类准确率是过度设计」:只要下游有兜底(RAG 答不出时提示换问法),路由错了也不致命。
- 结尾引出:路由判断错了用户会看到什么?——02-11 拒答。
时长:3min
讲师备忘
| 项 | 内容 |
|---|---|
| 课前必做 | 准备一个可现场拆解的复合需求;准备四类路由的测试样例 |
| 最容易超时处 | P2 的需求拆解,容易变成需求评审会——控制在 3 分钟 |
| 学员最常问 | 「分类用规则不行吗?」答:简单场景可以,长尾表述还是需要模型 |
| 现场备用 | 分类不准 → 现场调 temperature 到 0 再跑一次,通常立刻改善 |