Corte de fibra, fallo del router, avería del operador, incidencia en un conmutador industrial, enlace de radio inestable: una interrupción de la red industrial puede dejar un sistema SCADA fuera de servicio, aislar los controladores lógicos programables, interrumpir el envío de alarmas y ralentizar el diagnóstico sobre el terreno. Para evitar que un incidente de telecomunicaciones se convierta en una parada de producción, es necesario diseñar una continuidad de red OT con conmutación automática a LTE, doble SIM, supervisión activa, alertas y reglas de prioridad adaptadas a los usos críticos.
El problema de los cortes de red en el sector industrial
En un entorno industrial, la red no es un mero servicio de comodidad. Conecta el SCADA con los controladores lógicos programables, los sensores con el sistema de supervisión, los operadores con las interfaces de control, los técnicos de mantenimiento con los equipos remotos y los sistemas de registro con los datos de producción.
Cuando esta red falla, las consecuencias pueden ser inmediatas.
-
El SCADA pierde la conexión con los controladores lógicos programables: ya no hay datos en tiempo real, ni control remoto, ni visibilidad centralizada.
-
En ocasiones, los operadores deben intervenir físicamente en cada equipo, lo que alarga los plazos y aumenta el riesgo de error.
-
Los registros de producción, los historiales de mediciones y los registros de eventos pueden presentar lagunas difíciles de interpretar.
-
Las alarmas críticas ya no se transmiten al centro de supervisión ni al servicio de guardia.
-
El diagnóstico se ralentiza, ya que hay que distinguir entre un fallo de red, un fallo del controlador lógico, un fallo de la aplicación o un incidente provocado por el operador.
-
Las sedes aisladas o con múltiples sedes dependen en gran medida de la calidad del enlace WAN principal.
-
Las infraestructuras críticas, como las del agua, la energía, la sanidad, la logística o determinados procesos continuos, deben demostrar su capacidad de continuidad y recuperación.
El principal riesgo no es solo el corte en sí mismo, sino la falta de un mecanismo automático para detectar, conmutar, alertar y volver al estado nominal.
¿Por qué un corte en la red eléctrica puede detener la producción?
No todas las interrupciones de la red provocan una parada inmediata. Algunas instalaciones siguen funcionando a nivel local gracias a los controladores lógicos, los circuitos de regulación y los dispositivos de seguridad in situ. Sin embargo, en cuanto se hace necesaria la supervisión, la coordinación entre varios equipos o la intervención a distancia, la pérdida de conexión a la red afecta gravemente al funcionamiento.
| Elemento afectado | Efecto inmediato | Riesgo industrial |
|---|---|---|
| SCADA | Pérdida de visibilidad y control | Control limitado o parada por precaución |
| Controladores PLC | Inaccesibles desde el sistema de supervisión | Diagnóstico y recuperación más lentos |
| Alarmas | No transmitidas o retrasadas | Detección tardía de incidentes |
| Historial | Datos faltantes | Análisis de calidad y trazabilidad mermados |
| Acceso remoto | Imposibilidad de realizar el mantenimiento | Desplazamiento al terreno obligatorio |
| Cámaras IP | Pérdida de control visual | Vigilancia reducida |
| Telelectura | Datos no transmitidos | Alteraciones en la facturación, la elaboración de informes o el cumplimiento normativo |
Por lo tanto, una red OT debe concebirse como una infraestructura de disponibilidad. La redundancia no sirve únicamente para «tener Internet», sino para mantener las funciones críticas durante el fallo del enlace principal.
Las causas más frecuentes de las interrupciones en la red OT
Las averías en las redes industriales tienen diversas causas. Algunas se deben al operador, otras a la propia instalación.
-
Corte de la fibra óptica debido a obras o a un incidente de ingeniería civil.
-
Fallo del decodificador, el router, el cortafuegos o el módem.
-
Corte de suministro eléctrico en un rack de red o en un armario de campo.
-
Mala calidad de una conexión ADSL, SDSL, por radio o 4G.
-
Saturación temporal del enlace principal.
-
Configuración de red incorrecta tras la intervención.
-
Fallo de un conmutador industrial o de un convertidor de fibra.
-
Bucle de red, tormenta de difusión o fallo de segmentación.
-
Mantenimiento no programado por parte del operador.
-
Incidente cibernético que obliga a aislar una parte de la red.
La continuidad de la red de tecnología operativa (OT) no puede basarse en un único escenario. Debe supervisar la disponibilidad real del servicio y realizar la conmutación cuando el enlace principal deje de cumplir su función.
Arquitectura recomendada con conmutación automática a LTE y doble SIM
Una arquitectura de conmutación por error LTE industrial incluye una pasarela entre la red OT y los enlaces de salida. Esta pasarela supervisa el enlace principal, mantiene un enlace de respaldo móvil y aplica una política de conmutación automática.
Esta arquitectura permite mantener una ruta de red cuando el enlace principal deja de estar disponible. Además, proporciona a los equipos pruebas de lo que ha ocurrido: hora de la interrupción, enlace utilizado, duración de la conmutación, restablecimiento del servicio y calidad observada.
Nuestro enfoque
La pasarela Eziwan supervisa constantemente la calidad del enlace principal, ya sea de fibra, ADSL, SDSL, Ethernet de operador u otro enlace WAN. En cuanto se detecta un umbral de deterioro, puede conmutarse automáticamente a un enlace LTE de reserva.
La conmutación puede activarse mediante varias señales.
-
Pérdida total del enlace principal.
-
Latencia anómala.
-
Pérdida excesiva de paquetes.
-
El túnel VPN no está disponible.
-
La fluctuación es demasiado elevada para aplicaciones sensibles.
-
Fallos repetidos en las pruebas de disponibilidad.
-
Deterioro duradero más allá de un umbral definido.
Dos tarjetas SIM asociadas a operadores diferentes refuerzan la redundancia. Si la red móvil principal no está disponible o presenta problemas, la pasarela puede utilizar una segunda tarjeta SIM. Para los emplazamientos más críticos o que se encuentren fuera de la cobertura móvil, se puede añadir un enlace por satélite —por ejemplo, Starlink o VSAT, según el contexto— como tercer nivel de respaldo.
Características principales
Dual SIM activo/pasivo
El sistema Dual SIM activo/pasivo consiste en disponer de una tarjeta SIM principal y otra secundaria lista para tomar el relevo. Ambas tarjetas pueden pertenecer a operadores diferentes, con el fin de reducir la dependencia de una única infraestructura móvil.
Este enfoque resulta especialmente útil cuando el sitio web depende de un operador que funciona correctamente en condiciones normales, pero debe seguir estando accesible en caso de avería local, saturación o mantenimiento de la red.
Conmutación transparente para servicios críticos
La conmutación por error debe ser lo más discreta posible en entornos industriales. Dependiendo de los protocolos, la configuración de la VPN, los tiempos de espera de las aplicaciones y los mecanismos de reconexión, algunas sesiones pueden mantenerse activas tras la conmutación o restablecerse automáticamente.
El objetivo es mantener las funciones críticas: alarmas, supervisión, acceso remoto, notificación de estados, comandos autorizados y telemetría prioritaria. Los flujos menos urgentes pueden ralentizarse o suspenderse durante el funcionamiento a través de LTE.
Sondas de calidad de la red
Una interrupción brusca es fácil de detectar. Un deterioro progresivo es más peligroso, ya que la conexión parece seguir activa, aunque las aplicaciones se vuelven inestables.
Las sondas de calidad controlan, entre otras cosas:
-
La latencia.
-
La giga.
-
La pérdida de paquetes.
-
El estado del túnel VPN.
-
La disponibilidad de objetivos de referencia.
-
La calidad de la radio LTE.
-
El operador de telefonía móvil activo.
Estas medidas permiten realizar la conmutación antes de que el sistema de supervisión deje de ser operativo.
Alertas en tiempo real
Las alertas deben avisar a las personas adecuadas en el momento oportuno. Una notificación útil debe indicar el sitio web afectado, el enlace que falla, el enlace de reserva utilizado, la hora del cambio, el estado del túnel y el nivel de gravedad.
Los canales pueden incluir:
-
Correo electrónico.
-
SMS.
-
Webhook.
-
Supervisión centralizada.
-
Incidencia en una herramienta de ITSM.
-
Notificación a un equipo de guardia.
La alerta de restablecimiento es tan importante como la alerta de corte, ya que permite confirmar el retorno a la situación normal y analizar la duración real del incidente.
Informe de disponibilidad
Un informe de disponibilidad ofrece una visión objetiva de las incidencias de red. Puede ser útil para los equipos de operaciones técnicas, el departamento de sistemas de información, el responsable de mantenimiento, el responsable de calidad o el proveedor de acceso.
Un buen informe debe incluir:
-
El número de cambios.
-
El tiempo acumulado en el enlace de respaldo.
-
Los enlaces utilizados.
-
Las horas de corte y restablecimiento del servicio.
-
Las causas detectadas.
-
La calidad de la señal de radio observada.
-
Los periodos de deterioro previos a la desconexión.
-
Eventos recurrentes por sede.
Estos datos ayudan a decidir si hay que cambiar de operador, desplazar una antena, añadir un enlace por satélite, sustituir un router o revisar la topología de la red.
Compatibilidad con los equipos IP existentes
Una pasarela de continuidad de red debe integrarse sin que sea necesario realizar una renovación completa de los equipos industriales. Puede funcionar con numerosos equipos IP ya existentes: SCADA, controladores lógicos de Siemens, Schneider o Rockwell, cámaras IP, interfaces hombre-máquina (IHM), servidores de historización, conmutadores industriales, sensores conectados, RTU y pasarelas de IoT.
El reto consiste en mantener los flujos de datos útiles sin exponer directamente los equipos de TI a Internet.
Degradación gradual configurable
Cuando una página web funciona con LTE, puede ser necesario reducir ciertos usos para controlar el ancho de banda y los costes de datos. La degradación sin pérdida de calidad consiste en mantener las funciones críticas y restar prioridad al resto.
Ejemplos de prioridades:
-
Mantener las alarmas críticas.
-
Mantener los controles necesarios para el funcionamiento.
-
Mantener el túnel VPN para el servicio de guardia.
-
Reducir la frecuencia de las consultas no urgentes.
-
Suspender algunas transmisiones de vídeo.
-
Aplazar las exportaciones de gran volumen.
-
Limitar las actualizaciones no críticas.
Esta lógica convierte la conexión LTE en una verdadera continuidad del servicio, y no en un simple sistema de respaldo «best effort».
Soporte técnico de tercer nivel para Satellite
En el caso de emplazamientos muy aislados, el 4G o el 5G no siempre son suficientes. Un puerto WAN Ethernet permite añadir un módem satelital como tercer nivel de respaldo. Esta arquitectura con triple redundancia es adecuada para emplazamientos en los que la pérdida de conectividad tiene un impacto considerable: agua, energía, seguridad, telelectura crítica, supervisión de emplazamientos aislados o gestión de múltiples emplazamientos.
No obstante, el satélite debe concebirse como un enlace por derecho propio: es necesario validar la visibilidad del cielo, la alimentación eléctrica, la fijación, la latencia, la supervisión, el coste y las normas de prioridad.
Ciclo de transición de un vínculo industrial
Una conmutación por error eficaz sigue un ciclo claro: vigilancia, detección, verificación, conmutación, supervisión del modo de emergencia y retorno controlado.
El retorno a la conexión principal debe controlarse. Si la señal se recupera durante unos segundos y luego vuelve a caer, un retorno demasiado rápido puede provocar oscilaciones. Por lo tanto, hay que esperar a que se alcance un periodo de estabilidad antes de volver al nivel nominal.
¿A qué flujos hay que dar prioridad durante un corte de suministro?
No todos los flujos de OT tienen el mismo nivel de criticidad. Un buen plan de continuidad define qué es lo que debe mantenerse durante una interrupción de la conexión principal.
| Flujo | Prioridad | Comentario |
|---|---|---|
| Alarmas críticas | Muy alta | Debe mantenerse incluso en modo degradado |
| Comandos de explotación | Alta | Debe limitarse a los usos autorizados |
| Supervisión SCADA | Alta | Frecuencia de sondeo ajustable en función del ancho de banda |
| Acceso remoto para mantenimiento | Media a alta | Según el procedimiento de guardia |
| Registro detallado | Media | Se puede reducir temporalmente |
| Vídeo IP | Variable | A menudo consume mucho ancho de banda |
| Exportaciones por lotes | Baja | Se pospondrán tras el restablecimiento |
| Actualizaciones | Baja | Se bloquearán durante la recuperación |
Esta priorización evita que un flujo secundario consuma el enlace LTE en detrimento de las alarmas o de la supervisión esencial.
Ejemplo de política de conmutación por error
Una política de conmutación por error debe estar documentada y ser comprensible para los equipos de TI, TO y mantenimiento. En ella se describen los umbrales, las conexiones de respaldo, las alertas y las normas de restablecimiento.
site:
nom: usine_ligne_conditionnement
criticite: haute
lien_principal:
type: fibre
surveillance:
latence_max: 250ms
perte_paquets_max: 5%
echec_sonde: 3
duree_degradation: 30s
secours:
lte:
mode: dual_sim
sim_1: operateur_a
sim_2: operateur_b
priorite:
- alarmes
- supervision
- acces_maintenance
satellite:
actif: optionnel
usage: dernier_recours
retour_nominal:
stabilite_requise: 10min
retour_automatique: true
alertes:
basculement: sms_email
degradation: email
retour_service: sms_email
rapport_mensuel: pdf
Los valores deben adaptarse a cada emplazamiento. Una estación de bombeo aislada, una línea robotizada y un centro de supervisión multiemplazamiento no tienen las mismas limitaciones.
Medición del MTTR de la red OT
El MTTR, o tiempo medio de recuperación, es un indicador fundamental. En una red industrial, no solo hay que medir el tiempo de reparación del enlace principal, sino también el tiempo necesario para mantener o restablecer el servicio.
Se pueden distinguir varios tiempos.
| Indicador | Definición | Objetivo |
|---|---|---|
| Tiempo de detección | Plazo entre el incidente y su detección | Lo más breve posible |
| Tiempo de conmutación | Plazo hasta la activación del sistema de respaldo | Compatible con las aplicaciones |
| Tiempo de notificación | Plazo hasta la alerta al equipo | Inmediato o casi inmediato |
| Tiempo de diagnóstico | Plazo para identificar la causa | Reducido gracias a los registros |
| Tiempo de reparación | Plazo para restablecer el enlace principal | Depende del proveedor |
| Tiempo de restablecimiento nominal | Plazo antes del restablecimiento controlado | Evitar oscilaciones |
La conmutación de emergencia a LTE no repara la fibra cortada. Reduce el impacto operativo mientras se lleva a cabo la reparación.
SLA, disponibilidad y continuidad de la producción
Un objetivo de disponibilidad, como el 99,9 % o el 99,97 %, no debe utilizarse como una promesa genérica fuera de contexto. Depende de la arquitectura, de las conexiones disponibles, de la cobertura móvil, del suministro eléctrico, del mantenimiento, de los contratos con los operadores y de la supervisión.
Por el contrario, una arquitectura redundante permite crear un destino de servicio más robusto que una única conexión.
| Arquitectura | Resiliencia esperada | Limitación principal |
|---|---|---|
| Conexión WAN única | Baja | Cualquier fallo deja el sitio fuera de servicio |
| WAN + LTE con una sola SIM | Media | Dependencia de un operador móvil |
| WAN + doble SIM | Alta | Dependencia de la cobertura móvil |
| WAN + doble SIM + satélite | Muy alta | Coste, latencia y complejidad |
| Multisitios supervisados | Alta si se gestiona bien | Requiere procedimientos claros |
La disponibilidad real debe medirse a lo largo del tiempo mediante informes útiles, y no limitarse a lo que se establece en un contrato.
Seguridad: garantizar la continuidad sin poner en riesgo la OT
Una conexión de emergencia mal diseñada puede suponer un riesgo cibernético. Por ejemplo, un módem 4G conectado directamente a un controlador lógico programable (PLC), con una interfaz de administración expuesta, puede crear una puerta de entrada no controlada.
Es imprescindible seguir las buenas prácticas de seguridad.
-
Ningún servicio OT está expuesto directamente en Internet.
-
Túnel VPN cifrado hacia una plataforma controlada.
-
Cuentas nominativas para el acceso remoto.
-
Autenticación fuerte cuando se autoriza el acceso humano.
-
Segmentación entre la red de TI, la DMZ y la red de OT.
-
Filtrado de los flujos por destino y uso.
-
Registro de las conexiones y las conmutaciones.
-
Revocación rápida de los accesos de los proveedores.
-
Supervisión de la configuración y de los eventos.
Este enfoque se inscribe en los principios de defensa en profundidad que se aplican en la ciberseguridad industrial, especialmente en los enfoques inspirados en la norma IEC 62443.
Conmutación por error en LTE y la norma IEC 62443
La norma IEC 62443 no se limita a la disponibilidad de la red. Aborda, de forma más amplia, la ciberseguridad de los sistemas industriales: zonas, canales, requisitos de seguridad, gestión de riesgos, refuerzo de la seguridad y gobernanza. Un sistema de conmutación de emergencia por LTE puede contribuir a este enfoque, pero por sí solo no garantiza que una infraestructura cumpla con la norma.
Puede ayudar en varios aspectos técnicos.
-
Separación de las zonas y los conductos de la red.
-
Control de los accesos remotos.
-
Registro de eventos de conectividad.
-
Reducción de la exposición directa de los equipos de tecnología operativa.
-
Mantenimiento de determinadas funciones críticas en caso de incidencia en la red.
-
Documentación de los flujos y las dependencias.
El cumplimiento siempre debe evaluarse a nivel del sistema en su conjunto: arquitectura, procedimientos, usuarios, mantenimiento, proveedores y pruebas de funcionamiento.
Casos de uso industriales
Planta con SCADA centralizado
Una planta que supervisa varias líneas desde un sistema SCADA centralizado depende en gran medida de la disponibilidad de la red. En caso de interrupción del enlace principal, la conmutación automática a LTE mantiene la visibilidad de las alarmas y los estados críticos hasta que se restablezca el enlace habitual.
Estación de bombeo o instalación de agua
Las instalaciones de agua potable y saneamiento suelen estar repartidas por un territorio extenso. La continuidad de la red permite mantener el envío de alarmas, los niveles, los fallos de los variadores, el estado de las bombas y la información necesaria para el servicio de guardia.
Producción energética
Una central solar, una estación de entrega o una unidad de almacenamiento debe transmitir sus datos de producción, averías en los inversores, alarmas y estados de disponibilidad. Una conexión de emergencia reduce el riesgo de pérdida de supervisión durante un fallo del operador.
Centro logístico o almacén automatizado
En un almacén automatizado, la red conecta el sistema de gestión de almacenes (WMS), las cintas transportadoras, los controladores lógicos programables (PLC), los sensores, el sistema de supervisión y, en ocasiones, las cámaras. Una interrupción puede ralentizar o bloquear los flujos físicos. La redundancia de la red ayuda a mantener las funciones prioritarias.
Máquina especial en las instalaciones de un cliente
Un fabricante de maquinaria puede equipar sus instalaciones con una pasarela que cuente con una conexión de reserva para mantener un acceso seguro para el mantenimiento. Esto reduce los desplazamientos y agiliza el diagnóstico cuando la red del cliente no está disponible o es inestable.
Lista de comprobación previa a la implementación
Antes de poner en marcha un sistema de conmutación por error LTE industrial, es necesario verificar los aspectos fundamentales.
| Control | Pregunta | Prioridad |
|---|---|---|
| Cartografía | ¿Se han identificado los equipos y flujos críticos? | Alta |
| Cobertura móvil | ¿Se han probado dos operadores in situ? | Alta |
| Antenas | ¿Garantiza la ubicación una calidad de señal suficiente? | Alta |
| Alimentación | ¿Disponen de sistema de respaldo la pasarela y los equipos de red? | Alta |
| Umbrales | ¿Se han definido los criterios de conmutación? | Alta |
| Priorización | ¿Tienen prioridad los flujos críticos en LTE? | Alta |
| Seguridad | ¿No están expuestos directamente los servicios de operaciones? | Alta |
| Registros | ¿Se registran las conmutaciones? | Alta |
| Alertas | ¿Se notifica a los equipos adecuados? | Alta |
| Recuperación | ¿Se controla la recuperación del enlace principal? | Media |
| Pruebas | ¿Se ha realizado un simulacro de corte? | Alta |
La prueba de corte es imprescindible. Una arquitectura de contingencia que no se haya probado no deja de ser una hipótesis.
Errores frecuentes que hay que evitar
Añadir un módem 4G sin supervisión
Un módem 4G independiente puede servir de solución puntual, pero no siempre ofrece información sobre los cambios de red, la calidad de la señal, el consumo de datos o las incidencias recurrentes.
Utilizar el mismo operador para todos los enlaces
Si el enlace principal y el enlace móvil dependen del mismo operador o de la misma infraestructura local, la redundancia puede resultar menos eficaz. Es necesario buscar una independencia real cuando se trate de una instalación crítica.
No dar prioridad a los flujos
En caso de conmutación a LTE, algunos flujos pueden saturar el enlace: vídeo, copias de seguridad, exportaciones, actualizaciones o sincronizaciones masivas. Sin un sistema de priorización, las alarmas y la supervisión pueden verse afectadas.
Olvidarse del suministro eléctrico
Una conmutación por error de red no sirve de nada si la pasarela, el conmutador o la antena activa se quedan sin alimentación. Los equipos de continuidad deben conectarse a una fuente de alimentación de emergencia cuando la importancia crítica de los servicios así lo exija.
Volver demasiado pronto al enlace principal
Una conexión principal inestable puede provocar alternancias entre la WAN y la red LTE. Es necesario definir un periodo de estabilidad antes de volver al estado normal.
Cómo ayuda Eziwan a reducir el riesgo de parada
Eziwan centraliza la continuidad de la red OT en torno a una pasarela supervisada, capaz de supervisar las conexiones, cambiar a LTE, utilizar dos tarjetas SIM, notificar a los equipos y generar informes.
| Necesidad | Respuesta de Eziwan | Beneficio |
|---|---|---|
| Corte de fibra o xDSL | Conmutación automática a LTE | Mantenimiento de las funciones críticas |
| Fallo del operador móvil | Doble SIM con operadores distintos | Redundancia reforzada |
| Diagnóstico difícil | Registros e historial de eventos | Análisis más rápido |
| Supervisión deficiente | Alertas en tiempo real | Reacción inmediata |
| Ubicaciones aisladas | Antenas adaptadas y satélite opcional | Cobertura ampliada |
| Costes de datos | Degradación sin coste adicional configurable | Priorización de los flujos esenciales |
| Auditoría de fiabilidad | Informe de disponibilidad | Prueba de funcionamiento |
Esta continuidad se puede combinar con la pasarela Eziwan, la supervisión a través de la nube Eziwan y las arquitecturas de conectividad industrial.
Plan de pruebas recomendado
Una vez instalada la solución, hay que comprobar su funcionamiento mediante una prueba controlada.
La prueba debe comprobar la activación de las alarmas, el comportamiento del SCADA, la disponibilidad de los controladores lógicos programables, las notificaciones, los registros y el restablecimiento de la conexión principal. Debe realizarse en un entorno controlado, con la participación de los equipos implicados.
Conclusión
Una interrupción de la red industrial puede provocar una parada de la producción cuando el sistema SCADA, los controladores lógicos programables, las alarmas y los accesos remotos dependen de una única conexión. La conmutación automática a LTE con doble SIM reduce este riesgo al añadir una ruta de respaldo automática, supervisada y operativa.
El valor de una solución como Eziwan no se limita al módem 4G. Reside en el conjunto de sus características: supervisión de la calidad de la red, conmutación automática, Dual SIM, alertas en tiempo real, informes de disponibilidad, priorización de flujos e integración con una arquitectura OT segura. Para las instalaciones industriales críticas, este enfoque convierte la continuidad de la red en un mecanismo controlado, en lugar de una reacción de emergencia.
Para profundizar en el tema
- Copia de seguridad 4G industrial — activa automáticamente una conexión 4G de respaldo en caso de corte de fibra
- Redundancia de Internet industrial — arquitecturas de redundancia para garantizar la continuidad de la producción
- Conectividad industrial — compara las tecnologías de conectividad para tus instalaciones industriales
- Router 4G industrial — routers industriales con conmutación automática ante fallos y Dual SIM integrado
- Router LTE industrial — routers LTE de alto rendimiento para entornos industriales críticos