Appearance
L03-14 案例一:智能运维助手
全局中心内容:运维场景是 Agent 的最佳落地点之一——信息分散、步骤明确、但需要判断。 全局讲解主线:场景痛点 → 能力设计 → 工具集 → 诊断流程 → 安全边界 → 编码 → 效果与局限。
P1 · 产出页
中心内容:一个能查指标、看日志、定位根因并给出处置建议的运维 Agent。
- 讲解技巧
- 开场场景:凌晨告警,工程师要在 5 个系统之间跳转查 20 分钟才能定位。
- 说明这正是 Agent 擅长的事:跨系统信息整合 + 有依据的推断。
- 时长:30s
P2 · 场景痛点
中心内容:监控系统、日志系统、CMDB、工单系统各自孤立。
- 讲解技巧
- 强调「人的工作其实是拼接信息」,这恰好是 LLM 的强项。
- 时长:4min
P3 · 能力边界设计
中心内容:先明确「做什么/不做什么」,再写工具。
页面内容:能力清单(查指标/查日志/查变更/建议)与禁区(直接改生产配置)
讲解技巧
- 强调禁区这一栏:运维 Agent 的第一原则是不能自己动手改生产。
- 给出分级:诊断全自动,处置需审批,回滚需人工。
时长:5min
P4 · 工具集设计
中心内容:八个工具,全部只读。
页面内容:工具清单与风险分级
讲解技巧
- 讲清只读设计带来的好处:可以放心地让它自由探索,不用层层审批。
- 提醒工具返回值要精简,日志原文可能几十 MB,必须截断和采样。
时长:6min
P5 · 诊断流程
中心内容:固定流程 + 自由探索结合。
页面内容:先查告警 → 看关联指标 → 查同期变更 → 看错误日志 → 定位 → 给建议
讲解技巧
- 讲清为什么用固定骨架:纯自由探索容易跑偏,先给一个 checklist 保证覆盖。
- 提醒流程要作为系统提示的一部分,而不是硬编码(保留灵活性)。
时长:6min
P6 · 安全边界
中心内容:只读工具 + 变更类操作审批 + 禁止高危命令。
- 讲解技巧
- 举例禁止项:
rm、DROP、直接 kubectl apply。 - 强调即便「只是建议」也要过滤,建议里不能出现危险的完整命令。
- 举例禁止项:
- 时长:5min
P7 · 编码:装配
中心内容:用 Harness 装配,复用前面所有 Guard。
- 讲解技巧
- 重点展示复用价值:这一节几乎没写新代码,只是配置。
- 这是 Harness 设计的回报时刻,要点明。
- 时长:6min
P8 · 效果与局限
中心内容:定位时间从 20 分钟降到 3 分钟,但复杂根因仍会误判。
- 讲解技巧
- 诚实讲局限:它给的是假设,不是结论,必须给出置信度和依据。
- 提醒要有「我无法定位」的兜底,别硬编一个原因。
- 时长:5min
P9 · 避坑与小结
中心内容:运维 Agent 的信任是慢慢建立的,先只给建议。
- 讲解技巧
- 给出落地节奏建议:先只读建议 → 统计采纳率 → 再逐步放开自动化。
- 引出下一节:代码审查 Agent——03-15。
- 时长:3min
讲师备忘
| 项 | 内容 |
|---|---|
| 课前必做 | 准备告警场景描述;准备工具清单表 |
| 最容易超时处 | P5 诊断流程,容易讨论到具体监控产品 |
| 学员最常问 | 「能不能自动重启服务?」答:可以,但必须审批 + 限次数 |
| 现场备用 | 无监控系统 → 用 Mock 数据源演示 |