Appearance
L04-05 私有化部署:数据不出域怎么做
全局中心内容:私有化的核心不是「能不能跑」,而是「成本、效果、合规」三者怎么平衡。 全局讲解主线:合规诉求 → 三种路径 → 推理框架选型 → 硬件估算 → 混合部署 → 降级 → 交付清单。
P1 · 产出页
中心内容:一套 Ollama(验证)+ vLLM(生产)的私有化方案与混合路由。
- 讲解技巧
- 开场明确:私有化通常是合规要求驱动的,不是技术偏好。
- 因此决策时要先问合规红线在哪。
- 时长:30s
P2 · 三种路径
中心内容:全公有云 / 混合 / 全私有。
页面内容:三者的数据流向、成本、效果对比
讲解技巧
- 推荐大多数企业走混合:敏感数据本地,通用能力上云。
- 强调要按数据敏感度分级,而不是一刀切全私有。
时长:6min
P3 · 推理框架选型
中心内容:Ollama 起步,vLLM 上生产。
页面内容:两者定位对比
讲解技巧
- 讲清定位差异:Ollama 是「方便」,vLLM 是「吞吐」。
- 给判断标准:并发超过个位数就要上 vLLM。
时长:6min
P4 · 硬件估算
中心内容:显存决定能不能跑,算力决定能跑多快。
页面内容:常见参数规模与显存需求对照
讲解技巧
- 给出可感知的数字:7B 模型 FP16 约 14GB 显存,量化后约 6GB。
- 提醒别忘了算 KV Cache 的显存占用,长上下文时很可观。
时长:6min
P5 · 效果落差管理
中心内容:本地小模型效果一定不如云端大模型,要提前对齐预期。
- 讲解技巧
- 这是私有化项目失败的主要原因:承诺了云端的效果,交付了本地的能力。
- 给出对策:先用评测集量化差距,再和业务方确认可接受范围。
- 时长:5min
P6 · 混合部署路由
中心内容:按租户/数据敏感度路由到本地或云端。
- 讲解技巧
- 强调路由规则要可审计:哪些数据走了云端必须有记录。
- 时长:5min
P7 · 编码:多后端适配
中心内容:通过 OpenAI 兼容协议统一接入。
- 讲解技巧
- 这是私有化最实用的一招:Ollama 和 vLLM 都兼容 OpenAI 协议,业务代码零改动。
- 时长:6min
P8 · 交付清单
中心内容:模型权重、部署脚本、监控、升级方案、降级预案。
- 讲解技巧
- 强调升级方案常被遗漏:模型也要更新,怎么在不中断服务的情况下换?
- 时长:4min
P9 · 避坑与小结
中心内容:别低估 GPU 运维成本,它是持续支出不是一次性投入。
- 讲解技巧
- 引出下一节:部署好了,能过评审吗——04-06 安全合规。
- 时长:3min
讲师备忘
| 项 | 内容 |
|---|---|
| 课前必做 | 准备显存估算表;准备三种路径对比图 |
| 最容易超时处 | P4 硬件估算,容易被追问具体型号 |
| 学员最常问 | 「7B 够用吗?」答:FAQ/分类够,复杂推理不够,需实测 |
| 现场备用 | 无 GPU → 用 CPU 小模型演示接入方式 |