在第一个客户来电之前发现光纤断纤
AI 自动巡检与根因分析让 NOC 在故障发生上取得了 30 分钟的先手,把被动救火转变为主动保障。
−47%
MTTR
−38%
来电投诉
−61%
SLA 违约
一家城域宽带服务商在海湾地区最密集的城市之一为 140,000 名 FTTH 用户提供服务,随着网络规模扩大,他们面临一个愈演愈烈的问题:总是从愤怒的客户口中才得知发生了故障。等工程师开始排查时,对用户的影响早已在社交媒体上传开。
背景
该运营商运行 Huawei 与 ZTE 混合的 OLT 网络,老区大量依赖架空光缆,新区则以地埋光缆为主。天气事件——尤其是罕见但强度极大的沙尘暴——会引发成簇的故障事件,而现有 NMS 将其呈现为数以千计的独立告警。压垮 NOC 的并不是故障本身,而是噪声。
既有的保障流程是:客户来电,工单打开,NOC 工程师跨 5 个工具排查,12–25 分钟后定位根因,采取处置,关闭工单。平均修复时长稳定在 38 分钟出头。企业专线的 SLA 违约每月 8–12 起。董事会希望在不用把人手翻倍的前提下取得改进。
我们的目标
- 把可见告警的量级压缩到可执行的信号——同时不遗漏真正的故障。
- 把任何新故障在数秒内回溯到真正的原因。
- 在用户来电前发现故障——也就是仅凭遥测数据主动发现。
- 对可以安全自动处置的故障类别进行自动修复(CPE 高温、RADIUS 鉴权抖动、常见的固件抖动)。
实施方法
六个月的分阶段推进,每一阶段以健康检查作为门禁
- 把所有 OLT 接入 Netxol NMM(SNMP、SSH、厂商 API)。
- 把所有告警以流式方式送入 Netxol 事件库,并在入库时附加拓扑上下文。
- 建立基线数据:每周告警数、每周投诉数、MTTR 分布。
- 启用拓扑感知归并——同 OLT 下同时抖动的 ONU 收敛为一条 OLT 端口事件。
- 基于时间窗的关联,可在父事件后 90 秒内抑制后续的余震告警。
- 首个测量窗口内可见告警量下降 86%;同期没有遗漏任何真实故障。
- 让 RCA 以影子模式运行 3 周。NOC 与 AI 得出的结论并排比对。
- 标定样本:置信度 ≥ 90% 的输出 200 条,其中 184 条正确(标定可接受)。
- 将 RCA 转为激活模式:每张工单一经打开,AI 的结论即随之附带。
- 预警特征模式库(Rx 光功率漂移、ONU 硬件反复重初始化等)。
- AI Auto-Crawler 持续巡检在网设备——先于客户来电自动开单。
- 首个完整测量月:42% 的故障工单在任何客户来电之前就已经打开。
- Auto-Fix 策略库:CPE 高温 → QoS 限速 + 通知;ONU 卡在第 4 阶段 → 受控重启。
- 每条动作都有影响面(blast radius)上限和验证门禁。
- Auto-Fix 上线首月,57% 的故障工单在无人工介入下即被解决。
意外收获 —— 面对告警风暴时的从容
此次部署最有价值的效果并不是事先设想到的。历史上沙尘暴会引发"告警风暴"——30 分钟内爆发 4,000 条以上事件,完全压垮 NOC。启用拓扑感知抑制和 AI 主动处置后,第 5 个月同类天气事件只给 NOC 留下 71 条需要处理的事件;其余要么被抑制(挂到了已知父事件下),要么被自动修复(重启、模板重推)。NOC 用"可控的糟糕一天"取代了过去的"报废的一个班次"。
新的 SLA 品类成为可能
在第 4 阶段结束后,运营商为中小企业客户推出"Proactive Care"档位,合同层面承诺 30 分钟的主动通知窗口。他们之所以敢卖这个档位,是因为平台已经能持续兑现这一承诺。
成果
| Metric | Before | After | Δ |
|---|---|---|---|
| 每日可见告警数 | 2,400(平均) | 230 | −90% |
| 平均修复时长 | 38 分钟 | 20 分钟 | −47% |
| 每月故障来电数 | 11,400 | 7,050 | −38% |
| 每月 SLA 违约数 | 10(平均) | 4 | −61% |
| 故障主动发现比例 | 0% | 42% | 新增能力 |
使用的技术栈
- Netxol NMM —— Huawei + ZTE 适配器,支持 SNMP、syslog、厂商 API。
- Netxol AI RCA Engine —— 贝叶斯 + 拓扑图 + 历史回溯。
- Netxol AI Auto-Crawler —— 持续的异常检测。
- Netxol Auto-Fix 策略引擎,内置影响面上限。
- 事件库配合拓扑感知的抑制与归并。
经验教训
- RCA 在转为激活模式前至少运行 3 周影子模式。NOC 需要亲眼看到它"如何思考"。
- 标定不可妥协——按置信度区间分别度量准确率,只对高于阈值的区间下手。
- 影响面上限是"可靠系统"与"危险系统"的分水岭。对单位时间内的动作数量设置硬性上限。
- 要主动、大力地向客服部门沟通——他们需要知道平台如今会在客户之前先开单。
