跳到内容
NOS 1.2 · Aurora 现已发布——支持 24 种语言的对话式 NOCCore X100 旗舰——面向 500,000+ 用户的集群安装程序Field Engineer 伴侣应用——工单、GIS 和现场测试Netxol One 套件——NMM · CRM · ERP 统一身份部署案例·单台 Core X20 支撑 82,000 用户
Netxol
FTTH ISP · 14 万用户 · 中东

在第一个客户来电之前发现光纤断纤

AI 自动巡检与根因分析让 NOC 在故障发生上取得了 30 分钟的先手,把被动救火转变为主动保障。

AI 根因分析Auto-Fix保障拓扑
在第一个客户来电之前发现光纤断纤

−47%

MTTR

−38%

来电投诉

−61%

SLA 违约

一家城域宽带服务商在海湾地区最密集的城市之一为 140,000 名 FTTH 用户提供服务,随着网络规模扩大,他们面临一个愈演愈烈的问题:总是从愤怒的客户口中才得知发生了故障。等工程师开始排查时,对用户的影响早已在社交媒体上传开。

背景

该运营商运行 Huawei 与 ZTE 混合的 OLT 网络,老区大量依赖架空光缆,新区则以地埋光缆为主。天气事件——尤其是罕见但强度极大的沙尘暴——会引发成簇的故障事件,而现有 NMS 将其呈现为数以千计的独立告警。压垮 NOC 的并不是故障本身,而是噪声。

既有的保障流程是:客户来电,工单打开,NOC 工程师跨 5 个工具排查,12–25 分钟后定位根因,采取处置,关闭工单。平均修复时长稳定在 38 分钟出头。企业专线的 SLA 违约每月 8–12 起。董事会希望在不用把人手翻倍的前提下取得改进。

我们的目标

  • 把可见告警的量级压缩到可执行的信号——同时不遗漏真正的故障。
  • 把任何新故障在数秒内回溯到真正的原因。
  • 在用户来电前发现故障——也就是仅凭遥测数据主动发现。
  • 对可以安全自动处置的故障类别进行自动修复(CPE 高温、RADIUS 鉴权抖动、常见的固件抖动)。

实施方法

六个月的分阶段推进,每一阶段以健康检查作为门禁

1第 1 阶段 — 遥测归拢第 1–4 周
  • 把所有 OLT 接入 Netxol NMM(SNMP、SSH、厂商 API)。
  • 把所有告警以流式方式送入 Netxol 事件库,并在入库时附加拓扑上下文。
  • 建立基线数据:每周告警数、每周投诉数、MTTR 分布。
2第 2 阶段 — 告警抑制第 4–8 周
  • 启用拓扑感知归并——同 OLT 下同时抖动的 ONU 收敛为一条 OLT 端口事件。
  • 基于时间窗的关联,可在父事件后 90 秒内抑制后续的余震告警。
  • 首个测量窗口内可见告警量下降 86%;同期没有遗漏任何真实故障。
3第 3 阶段 — AI 根因分析引擎第 8–14 周
  • 让 RCA 以影子模式运行 3 周。NOC 与 AI 得出的结论并排比对。
  • 标定样本:置信度 ≥ 90% 的输出 200 条,其中 184 条正确(标定可接受)。
  • 将 RCA 转为激活模式:每张工单一经打开,AI 的结论即随之附带。
4第 4 阶段 — 主动发现第 14–20 周
  • 预警特征模式库(Rx 光功率漂移、ONU 硬件反复重初始化等)。
  • AI Auto-Crawler 持续巡检在网设备——先于客户来电自动开单。
  • 首个完整测量月:42% 的故障工单在任何客户来电之前就已经打开。
5第 5 阶段 — 有边界的自动修复第 20–24 周
  • Auto-Fix 策略库:CPE 高温 → QoS 限速 + 通知;ONU 卡在第 4 阶段 → 受控重启。
  • 每条动作都有影响面(blast radius)上限和验证门禁。
  • Auto-Fix 上线首月,57% 的故障工单在无人工介入下即被解决。

意外收获 —— 面对告警风暴时的从容

此次部署最有价值的效果并不是事先设想到的。历史上沙尘暴会引发"告警风暴"——30 分钟内爆发 4,000 条以上事件,完全压垮 NOC。启用拓扑感知抑制和 AI 主动处置后,第 5 个月同类天气事件只给 NOC 留下 71 条需要处理的事件;其余要么被抑制(挂到了已知父事件下),要么被自动修复(重启、模板重推)。NOC 用"可控的糟糕一天"取代了过去的"报废的一个班次"。

新的 SLA 品类成为可能

在第 4 阶段结束后,运营商为中小企业客户推出"Proactive Care"档位,合同层面承诺 30 分钟的主动通知窗口。他们之所以敢卖这个档位,是因为平台已经能持续兑现这一承诺。

成果

MetricBeforeAfterΔ
每日可见告警数2,400(平均)230−90%
平均修复时长38 分钟20 分钟−47%
每月故障来电数11,4007,050−38%
每月 SLA 违约数10(平均)4−61%
故障主动发现比例0%42%新增能力

使用的技术栈

  • Netxol NMM —— Huawei + ZTE 适配器,支持 SNMP、syslog、厂商 API。
  • Netxol AI RCA Engine —— 贝叶斯 + 拓扑图 + 历史回溯。
  • Netxol AI Auto-Crawler —— 持续的异常检测。
  • Netxol Auto-Fix 策略引擎,内置影响面上限。
  • 事件库配合拓扑感知的抑制与归并。

经验教训

  • RCA 在转为激活模式前至少运行 3 周影子模式。NOC 需要亲眼看到它"如何思考"。
  • 标定不可妥协——按置信度区间分别度量准确率,只对高于阈值的区间下手。
  • 影响面上限是"可靠系统"与"危险系统"的分水岭。对单位时间内的动作数量设置硬性上限。
  • 要主动、大力地向客服部门沟通——他们需要知道平台如今会在客户之前先开单。