跳到内容
NOS 1.2 · Aurora 现已发布——支持 24 种语言的对话式 NOCCore X100 旗舰——面向 500,000+ 用户的集群安装程序Field Engineer 伴侣应用——工单、GIS 和现场测试Netxol One 套件——NMM · CRM · ERP 统一身份部署案例·单台 Core X20 支撑 82,000 用户
Netxol
战略

把 ISP 自动化做对:一份 90 天的行动手册

如果你有 90 天让运营成本与可靠性出现看得见的凹痕,这是我们会跑的顺序——以及原因。

Jan 30, 202611 分钟by Netxol Team
把 ISP 自动化做对:一份 90 天的行动手册

大多数自动化项目失败,不是因为技术错,而是因为顺序错。它们从最大、最显眼的东西开始,卡在整合上,到第四个月就耗尽了高管的耐心。这里是一个能让早期见效、构建后续胜利依赖的数据面、并在第 90 天产生可辩护成本下降的顺序。

第 0–10 天——审计

1盘点3 天
  • 列出运营栈里的每个系统——NMS、OLT 控制器、ACS、CRM、ERP、工单、ACS、GIS。
  • 拿到每个系统的 API 文档。标记哪些有可用 API,哪些只有 UI。
2痛点地图4 天
  • 和 NOC、客服、现场坐下来。画一张反复出现的人工的热力图。
  • 按类别抓取处理时长、工单量、上门率。
3速胜候选短名单3 天
  • 从热力图里挑 3 个候选,要满足:高频、低复杂度、单工具可自动化、可用省下的钱衡量。

第 10–30 天——数据面

几乎每一个后续胜利,都依赖有一个地方能一起查询网络状态、用户状态和现场活动。这是项目里最不讨好的 20 天——最后你不会有一个 demo 秀——但跳过它会让后面的一切时间加倍。

  • 搭起统一数据面(Netxol 或自建)。
  • 把 OLT 和 ACS 接入——网络侧先来,因为 CRM/ERP 侧更稳定。
  • 用现有人工拓扑校验 LLDP/CDP 拓扑发现。修正差异。
  • 开始把告警、事件、计数器流进统一存储。

第 30–60 天——速胜落地

数据面就位后,速胜短名单变得可实施。适合几乎所有人的三条是:

  1. 1新用户自动开通——消除每次开通 22 分钟的 NOC 时间和 7% 的首周错误率。
  2. 2对客户报障的 ONU 掉线做 AI RCA——把诊断时间从 12 分钟压到几秒,上门降低 30–40%。
  3. 3告警抑制/拓扑感知合并——把可见告警量压 80–90%,让 NOC 真的能读队列。

你在第 60 天会 demo 什么

端到端在 10 分钟内、从 CRM 点击到「上线」的新用户开通流。对一次真实故障的实时 RCA,带置信度分数与建议动作。一个终于让你看到真实信号的告警看板。

第 60–90 天——闭合环路

最后 30 天,自动化变为自主。你让平台去行动,而不只是建议。从最小、最低风险的动作类别开始。

  • 给一个类别配一条 Auto-Fix 策略——例如「若 CPE 高温持续 15 分钟,下发 QoS 限速并通知机主」。
  • 对 SFP 和 ONU 做预测性维护——在故障前浮现更换候选。
  • 高管自动报表——把分析师三天的月报换成自动生成的日报。
  • 容量规划管线——把首批 60 天饱和预测送到财务和工程的桌上。

第 90 天的好样子

−45%

NOC + 客服处理时长

诊断查询从 4 个标签页塌缩为 1 个。

−35%

可避免的上门

RCA 在派工前关闭更多案子。

+95%

新开通零接触

例外进入一个单一、定义清晰的队列。

−80%

可见告警量

拓扑感知抑制重复和余震。

为什么这样排序

三个原因。第一,数据面是其他一切的瓶颈,所以尽管不光鲜也要先做。第二,速胜建立高管与运营的信心——解锁其他预算和其他文化变革。第三,自主动作放最后,因为它是最要紧的一步,你希望它落在一个已经过压测的基座上。

延伸阅读