Skip to content

L03-14 案例一:智能运维助手 ​

全局中心内容:运维场景是 Agent 的最佳落地点之一——信息分散、步骤明确、但需要判断。 全局讲解主线:场景痛点 → 能力设计 → 工具集 → 诊断流程 → 安全边界 → 编码 → 效果与局限。


P1 · 产出页 ​

中心内容:一个能查指标、看日志、定位根因并给出处置建议的运维 Agent。

  • 讲解技巧
    • 开场场景:凌晨告警,工程师要在 5 个系统之间跳转查 20 分钟才能定位。
    • 说明这正是 Agent 擅长的事:跨系统信息整合 + 有依据的推断。
  • 时长:30s

P2 · 场景痛点 ​

中心内容:监控系统、日志系统、CMDB、工单系统各自孤立。

  • 讲解技巧
    • 强调「人的工作其实是拼接信息」,这恰好是 LLM 的强项。
  • 时长:4min

P3 · 能力边界设计 ​

中心内容:先明确「做什么/不做什么」,再写工具。

  • 页面内容:能力清单(查指标/查日志/查变更/建议)与禁区(直接改生产配置)

  • 讲解技巧

    • 强调禁区这一栏:运维 Agent 的第一原则是不能自己动手改生产。
    • 给出分级:诊断全自动,处置需审批,回滚需人工。
  • 时长:5min


P4 · 工具集设计 ​

中心内容:八个工具,全部只读。

  • 页面内容:工具清单与风险分级

  • 讲解技巧

    • 讲清只读设计带来的好处:可以放心地让它自由探索,不用层层审批。
    • 提醒工具返回值要精简,日志原文可能几十 MB,必须截断和采样。
  • 时长:6min


P5 · 诊断流程 ​

中心内容:固定流程 + 自由探索结合。

  • 页面内容:先查告警 → 看关联指标 → 查同期变更 → 看错误日志 → 定位 → 给建议

  • 讲解技巧

    • 讲清为什么用固定骨架:纯自由探索容易跑偏,先给一个 checklist 保证覆盖。
    • 提醒流程要作为系统提示的一部分,而不是硬编码(保留灵活性)。
  • 时长:6min


P6 · 安全边界 ​

中心内容:只读工具 + 变更类操作审批 + 禁止高危命令。

  • 讲解技巧
    • 举例禁止项:rm、DROP、直接 kubectl apply。
    • 强调即便「只是建议」也要过滤,建议里不能出现危险的完整命令。
  • 时长:5min

P7 · 编码:装配 ​

中心内容:用 Harness 装配,复用前面所有 Guard。

  • 讲解技巧
    • 重点展示复用价值:这一节几乎没写新代码,只是配置。
    • 这是 Harness 设计的回报时刻,要点明。
  • 时长:6min

P8 · 效果与局限 ​

中心内容:定位时间从 20 分钟降到 3 分钟,但复杂根因仍会误判。

  • 讲解技巧
    • 诚实讲局限:它给的是假设,不是结论,必须给出置信度和依据。
    • 提醒要有「我无法定位」的兜底,别硬编一个原因。
  • 时长:5min

P9 · 避坑与小结 ​

中心内容:运维 Agent 的信任是慢慢建立的,先只给建议。

  • 讲解技巧
    • 给出落地节奏建议:先只读建议 → 统计采纳率 → 再逐步放开自动化。
    • 引出下一节:代码审查 Agent——03-15。
  • 时长:3min

讲师备忘 ​

项内容
课前必做准备告警场景描述;准备工具清单表
最容易超时处P5 诊断流程,容易讨论到具体监控产品
学员最常问「能不能自动重启服务?」答:可以,但必须审批 + 限次数
现场备用无监控系统 → 用 Mock 数据源演示