编程 故障群里的截图,怎么变成 Agent 能检索的知识

2026-10-01 00:04:41

故障群里的截图,怎么变成 Agent 能检索的知识

信源:AI内参《AI Agent 重塑运维知识:从碎片化经验到自主 SRE 的智能进化》。抖音算法工程师王宁在 QCon 全球软件开发大会(2025/8/26)分享了 SOPAgent 架构,演讲稿《从私域知识到智能 Agent:构建智能运维知识库》由 InfoQ 发布。

传统 AIOps 在复杂排障场景下的瓶颈,往往不是模型能力不够,而是知识本身进不来:专家经验不可复制,文档更新总是滞后于系统变更。一次线上故障的真实处置过程,通常散落在故障群里贴的监控截图、事后的视频会议纪要、系统工单,以及对话里那些没写进任何文档的判断。这些碎片化的私域数据,才是运维知识沉淀真正的原料。SOPAgent 的做法,是把这条链路拆成四步。

多模态私域知识融合:先把截图翻译成人话

传统知识库只吃文本,而运维现场的信息大量以截图和语音形式存在。SOPAgent 用多模态大模型把聊天记录中的监控截图、视频会议纪要、系统工单等多源异构数据转成可理解的自然语言。

典型场景是:SRE 在故障群里直接发一张带框选区域的监控截图,系统能把它「翻译」成具体的告警信息和受影响组件。这一步的产出不是给人看的摘要,而是后续自动化诊断的输入。

结构化抽取与 GraphRAG

群聊对话是非结构化、碎片化的排障过程,直接把原文塞进知识库,检索效果不会好。SOPAgent 借鉴 ReAct 的思维链结构,让 LLM 持续从对话中抽取四类要素:

  • 问题(对话要解决的故障现象)
  • 操作 Action(SRE 实际执行了什么)
  • 观测结果 Observation(执行后看到了什么)
  • 思考过程 Thought(为什么这么判断)

抽取结果形成结构化知识片段,再通过 GraphRAG 构建动态更新的运维知识图谱,对散落的知识点做关联、聚类和主题定义。这样既提升检索效率,也能把一条完整的排障链路还原出来,而不是只返回几个孤立段落。

迭代式上下文管理

海量运维知识无法一次塞进单个 LLM 上下文窗口。这里采用迭代总结、分步生成的架构:不断摘要已有信息、增补新信息,让模型在全局视角下推理决策,绕开单次窗口的长度限制。

数据飞轮

SOPAgent 不是静态知识库,而是自我进化系统。LLM 新生成的故障复盘、SOP 文档会被重新注入并参与学习,形成持续迭代的闭环。

落地要处理的几件事

  • SOP 质量:LLM 生成的 SOP 文档可读性仍需提升,内容可能过于冗余。
  • 知识偏见与固化:Agent 依赖历史数据学习,如果数据本身带偏见(比如某位 SRE 的排障习惯有局限),这些偏见会被固化进图谱。需要保证知识的多样性和中立性,让 Agent 有能力质疑甚至纠正过去的经验。
  • 责任与可追溯:Agent 生成错误 SOP、或执行了错误的止损操作,责任归谁?决策如何保证可解释、可追溯?这要求在架构里内嵌严格的审查机制、故障回滚能力和人类干预点,在效率与安全性之间取得平衡。
  • 图谱会过期:知识图谱作为「大脑」,除了自动抽取和关联知识,还要能自主识别知识的时效性、冲突性并智能纠正优化。这是走向自主运维的关键中间层。

往更远看,多 Agent 协作是方向:诊断 Agent、恢复 Agent、优化 Agent 各司其职,通过智能调度协同处理复杂故障,并构建开放可扩展的 Agent 生态。

收益与角色迁移

目前能落地的收益包括自动化故障诊断、知识问答、SOP 文档生成、OnCall 周报自动生成。资深 SRE 的工作重心也从「写文档」「救火」,转向 Agent 的训练师、监督者和架构师。

推荐文章

程序员茄子在线接单