10 problemas operativos que seguimos encontrando dentro de los ISP de FTTH
Una lista contrastada en campo de los problemas con los que nos topamos el primer día de casi todo despliegue, y los patrones para solucionarlos.
En los últimos 24 meses hemos entrado en la trastienda de operadores con bases de abonados que van de 8.000 a 220.000. Los titulares difieren. Los problemas subyacentes son casi idénticos. Esta es la lista contrastada en campo, y qué seguimos haciendo con ellos.
1. Dos NMS, uno por cada proveedor de OLT
Siempre que un operador adquiere a otro, aparecen dos NMS. Cada uno es "la fuente de verdad" para su propio equipo. Los ingenieros mantienen ambas pestañas abiertas. Los errores ocurren en los uniones. La consolidación en un NMS agnóstico al proveedor se paga sola en 9–12 meses solo en licencias y en 3–4 meses en reducción de errores.
2. El CRM no sabe qué está haciendo la red
Atención al cliente está al teléfono con un abonado que se queja, y la única señal que tienen de la red es "activo" / "no activo". Si el WAN del abonado está arriba pero el WiFi en el CPE está mal configurado, el agente no tiene forma de saberlo. Cerrar esta brecha de señal es la mayor jugada disponible para la mayoría de operadores.
3. Aprovisionar tarda más de lo que debería por una API que falta
En nueve de cada diez tiendas de aprovisionamiento manual, hay exactamente una herramienta (a menudo el controlador de OLT) que no tiene una API usable. Así que una persona ejecuta un script de CLI. Todo lo demás está automatizado. El coste de ese único script de CLI son días de latencia y una larga cola de errores tipográficos.
4. La topología está en tres hojas de cálculo diferentes
Campo tiene una Google Sheet. Ingeniería tiene un Visio. El NMS tiene su propio grafo auto-descubierto. Ninguno concuerda. El RCA no puede funcionar sin topología canónica, y topología canónica significa derivada de LLDP/CDP desde la red viva, aumentada a mano solo en las costuras.
5. El firmware está muy desactualizado, o demasiado fresco
No hay política consistente. O los CPE corren firmware de hace 4 años con CVE conocidas, o fueron empujados a la última beta el mes pasado y el 2 % de ellos ahora se cuelga cada 12 horas. La solución es una política de despliegue por etapas con puertas de salud, integrada en el ACS.
6. El suelo de ruido de alarmas es demasiado alto
Un NMS típico saca a la superficie 4.000–20.000 alarmas al mes. Un NOC típico lee 50. El resto se tira al suelo y estadísticamente entierra las de verdad. La supresión con IA basada en topología y correlación histórica corta el volumen visible en un 80–95 % sin perder las accionables.
7. Sin copia del running-config del OLT, en ninguna parte
Hemos entrado en centros de operaciones donde el único dispositivo más caro de la red no tiene copia de seguridad del running-config más allá de "el portátil del ingeniero". Cuando ese OLT muere un sábado por la noche, el tiempo de recuperación es de días, no horas. Las copias de seguridad automatizadas diarias con versionado estilo git son requisito básico.
8. RADIUS es el punto único de fallo secreto
En el operador que evaluamos por última vez, cada minuto de indisponibilidad de RADIUS costaba aproximadamente 400 sesiones y una ola de llamadas entrantes. El RADIUS corría en una sola VM, tras un solo balanceador de carga, sin failover en clúster. Esta es, dolorosamente, la configuración más común que encontramos.
9. Los informes tardan tres días en producirse
Un informe ejecutivo mensual no debería costar tres días de tiempo de analista. Lo hace, porque los datos viven en cuatro herramientas y el analista es la integración. La generación de informes asistida por IA con narrativas plantilladas lo convierte en una hora, y el analista gasta el tiempo ahorrado en algo que solo los humanos pueden hacer.
10. El "conocimiento" vive en la cabeza de dos personas
Todo ISP tiene al menos un ingeniero que sabe exactamente qué puerto de OLT tiene el SFP dudoso y qué abonado siempre va a llamar un viernes por la noche. Ese conocimiento no está escrito. Cuando el ingeniero cambia de trabajo, seis meses de calidad operativa se van con él. Codificar el conocimiento tribal en la plataforma —como política, como perfiles, como monitores— es el trabajo que la mayoría de operadores posponen y del que más se arrepienten de posponer.
Cómo puntuamos en el primer día
Cuando nos comprometemos con un nuevo operador, corremos una auditoría de 90 minutos contra estos diez patrones. La salida es un mapa de calor: rojo (arreglo prioritario), ámbar (cola), verde (ya sano). Tres o menos rojos es inusual.
