NTT DOCOMO 与作者在 MWC 展示:级联图算法加智能体编排,在商用网络上把根因分析从数小时压缩到数分钟
核心概要
该文梳理了图智能在网络领域从拓扑建模、本体语义、告警关联、依赖图、因果子图到图神经网络的演进,并提出以网络数字孪生图为基础、由级联图算法(分解、聚类、以告警集为参照的中心性排序)配合智能体编排进行根因分析的方法,作者称与 NTT DOCOMO 在 MWC 上于商用网络实现了分钟级根因分析。
深度剖析
文章把网络图智能的演进整理为一条连续的科研脉络:从仅表示物理连通性的拓扑图,到加入本体语义的知识图,再到编码因果的告警关联图、由 SDN/NFV 控制器实时自动生成的依赖图、把实时告警转成有向无环图的因果子图,以及学习隐藏小区间依赖与时空动态的图神经网络。 相对以往只描述单一图技术的文献,这里把各阶段定位为依次解决前一阶段局限的递进关系,并指出今天它们可以在同一张网络上同时叠加:拓扑、语义、时序 KPI 与 GNN 推理由智能体层统一协调。 属于综述性叙述,文中给出具体例证,如依赖图实现“95% accuracy in under 30 seconds”的贝叶斯故障定位且无需人工编写规则,告警关联图可在数分钟内把数万条原始告警压缩成一条因果链。
作者提出以“网络数字孪生图”为统一底座:顶点是带属性的设备,边是连接关系,持续同步地摄入跨网段、跨层的网络依赖、实时告警与 KPI,形成所有分析共用的拓扑感知数据结构。 把数字孪生从静态资产模型变成持续同步、可被算法与智能体共同查询的推理底座,使后续级联分析有统一输入。 文中以设计描述与 MWC 演示为支撑,未给出数字孪生同步延迟或数据规模的量化指标。
核心方法是一个三阶级联图算法流水线,逐级收窄搜索空间:先按连接数量与强度做分解,把候选从数千节点降到数百;再用 Louvain 或标签传播做社区检测聚类,把候选从数百降到数十;最后在簇内用中心性算法排序。 关键改动在于把中心性度量“以告警集为参照”重新计算:个性化 PageRank 从告警节点出发做随机游走以定位共同祖先,度中心性只统计连向告警节点的边(文中举例:总连接 50 但零告警连接的网关得 0 分,5 条告警连接的交换机得 5 分),告警相对接近度只算到告警节点的平均距离,从而让几何中心失去意义、最靠近故障簇的节点排第一。 文中给出算法机制与拓扑适配逻辑(分层、星形、网状分别对应不同度量),并称在商用网络演示中达到分钟级根因分析;未提供准确率、召回率或对照实验数据。
智能体层负责自适应编排:先查事件知识库,高置信匹配则直接套用既定处置;无匹配时先做复杂度分诊(受影响节点数、跨连通分量的拓扑扩散、故障签名的语义清晰度),再调用级联;得到排序候选后向外扩展两到三跳构建故障子图,结合告警时间线、知识库与运行手册给出带置信度的根因判定,并开单或并入已有工单,同时接收 NOC 反馈持续学习,另提供可按需交互查询数字孪生的 AI 助手。 把图算法的数学精度与智能体的场景自适应结合起来,用拓扑感知的选择规则决定每种故障形态下侧重哪种中心性变体,而不是固定使用单一算法。 以与 NTT DOCOMO 在 MWC 的商用网络演示为证据,作者称实现分钟级根因分析;置信度由时间证据、拓扑模式匹配、中心性分数与关联告警数加权,但文中未给出权重或验证结果。
启示与展望
该结果面向拥有数字孪生图、实时告警与 KPI 数据源以及事件知识库的网络运营团队,尤其是需要处理跨层、多厂商、多代际网络的多层故障场景;作者称其与 NTT DOCOMO 在 MWC 上于商用网络实现了分钟级根因分析,说明该路径在真实网络环境中已被演示。文中提出的两个后续方向也界定了适用范围:一是分级自主,让智能体从建议、受监督执行、在批准护栏内受限行动,逐步走向对可逆、影响面小的成熟事件做端到端处置,并以预定义评估标准与影子模式结果决定是否升级、以性能漂移决定是否降级;二是自学习智能体,从重复交互中提炼可复用流程作为候选技能,且必须经人工明确批准才生效。
文中未给出级联流水线的准确率、召回率、误报率或与基线方法的对照结果,分钟级根因分析来自 MWC 演示的表述,缺少可复核的评测细节。数字孪生的同步频率、可支撑的图规模与数据源覆盖范围也未量化。置信度分数由时间证据、拓扑模式匹配、中心性分数与关联告警数加权,但权重设定与校准方式未说明。分级自主与自学习智能体被明确列为“Path forward”中的研究计划,尚无评估结果。此外,本文为博客式文章,配套的架构与运行手册在另一篇“Beyond correlation”文章中,因此本文对部署细节的覆盖是有限的。
