战略
把 ISP 自动化做对:一份 90 天的行动手册
如果你有 90 天让运营成本与可靠性出现看得见的凹痕,这是我们会跑的顺序——以及原因。
Jan 30, 202611 分钟by Netxol Team
大多数自动化项目失败,不是因为技术错,而是因为顺序错。它们从最大、最显眼的东西开始,卡在整合上,到第四个月就耗尽了高管的耐心。这里是一个能让早期见效、构建后续胜利依赖的数据面、并在第 90 天产生可辩护成本下降的顺序。
第 0–10 天——审计
1盘点3 天
- 列出运营栈里的每个系统——NMS、OLT 控制器、ACS、CRM、ERP、工单、ACS、GIS。
- 拿到每个系统的 API 文档。标记哪些有可用 API,哪些只有 UI。
2痛点地图4 天
- 和 NOC、客服、现场坐下来。画一张反复出现的人工的热力图。
- 按类别抓取处理时长、工单量、上门率。
3速胜候选短名单3 天
- 从热力图里挑 3 个候选,要满足:高频、低复杂度、单工具可自动化、可用省下的钱衡量。
第 10–30 天——数据面
几乎每一个后续胜利,都依赖有一个地方能一起查询网络状态、用户状态和现场活动。这是项目里最不讨好的 20 天——最后你不会有一个 demo 秀——但跳过它会让后面的一切时间加倍。
- 搭起统一数据面(Netxol 或自建)。
- 把 OLT 和 ACS 接入——网络侧先来,因为 CRM/ERP 侧更稳定。
- 用现有人工拓扑校验 LLDP/CDP 拓扑发现。修正差异。
- 开始把告警、事件、计数器流进统一存储。
第 30–60 天——速胜落地
数据面就位后,速胜短名单变得可实施。适合几乎所有人的三条是:
- 1新用户自动开通——消除每次开通 22 分钟的 NOC 时间和 7% 的首周错误率。
- 2对客户报障的 ONU 掉线做 AI RCA——把诊断时间从 12 分钟压到几秒,上门降低 30–40%。
- 3告警抑制/拓扑感知合并——把可见告警量压 80–90%,让 NOC 真的能读队列。
你在第 60 天会 demo 什么
端到端在 10 分钟内、从 CRM 点击到「上线」的新用户开通流。对一次真实故障的实时 RCA,带置信度分数与建议动作。一个终于让你看到真实信号的告警看板。
第 60–90 天——闭合环路
最后 30 天,自动化变为自主。你让平台去行动,而不只是建议。从最小、最低风险的动作类别开始。
- 给一个类别配一条 Auto-Fix 策略——例如「若 CPE 高温持续 15 分钟,下发 QoS 限速并通知机主」。
- 对 SFP 和 ONU 做预测性维护——在故障前浮现更换候选。
- 高管自动报表——把分析师三天的月报换成自动生成的日报。
- 容量规划管线——把首批 60 天饱和预测送到财务和工程的桌上。
第 90 天的好样子
−45%
NOC + 客服处理时长
诊断查询从 4 个标签页塌缩为 1 个。
−35%
可避免的上门
RCA 在派工前关闭更多案子。
+95%
新开通零接触
例外进入一个单一、定义清晰的队列。
−80%
可见告警量
拓扑感知抑制重复和余震。
为什么这样排序
三个原因。第一,数据面是其他一切的瓶颈,所以尽管不光鲜也要先做。第二,速胜建立高管与运营的信心——解锁其他预算和其他文化变革。第三,自主动作放最后,因为它是最要紧的一步,你希望它落在一个已经过压测的基座上。
