Fibre coupée, routeur défaillant, panne opérateur, incident sur un switch industriel, lien radio instable : une coupure réseau industrielle peut rendre un SCADA indisponible, isoler des automates, interrompre la remontée d’alarmes et ralentir le diagnostic terrain. Pour éviter qu’un incident télécom ne devienne un arrêt de production, il faut concevoir une continuité réseau OT avec failover LTE, Dual SIM, supervision active, alertes et règles de priorité adaptées aux usages critiques.
Le Problème Des Coupures Réseau Industrielles
Dans un environnement industriel, le réseau n’est pas un simple service de confort. Il relie le SCADA aux automates, les capteurs à la supervision, les opérateurs aux interfaces de pilotage, les mainteneurs aux équipements distants et les systèmes de journalisation aux données de production.
Quand ce réseau tombe, l’impact peut être immédiat.
-
Le SCADA perd le contact avec les automates : plus de données temps réel, plus de commande distante, plus de visibilité centralisée.
-
Les opérateurs doivent parfois intervenir physiquement sur chaque équipement, ce qui allonge les délais et augmente le risque d’erreur.
-
Les journaux de production, historiques de mesures et traces d’événements peuvent présenter des trous difficiles à interpréter.
-
Les alarmes critiques ne remontent plus vers le centre de supervision ou l’astreinte.
-
Le diagnostic devient plus lent, car il faut distinguer une panne réseau, une panne automate, une panne applicative ou un incident opérateur.
-
Les sites isolés ou multi-sites dépendent fortement de la qualité du lien WAN principal.
-
Les infrastructures sensibles, comme l’eau, l’énergie, la santé, la logistique ou certains procédés continus, doivent démontrer une capacité de continuité et de reprise.
Le risque principal n’est pas seulement la coupure elle-même. C’est l’absence de mécanisme automatique pour détecter, basculer, alerter et revenir à l’état nominal.
Pourquoi Une Coupure Réseau Peut Arrêter La Production
Toutes les coupures réseau ne provoquent pas un arrêt immédiat. Certaines installations continuent localement grâce aux automates, aux boucles de régulation et aux sécurités terrain. Mais dès que la supervision, la coordination multi-équipements ou l’intervention distante devient nécessaire, la perte de réseau dégrade fortement l’exploitation.
| Élément touché | Effet immédiat | Risque industriel |
|---|---|---|
| SCADA | Perte de visibilité et de commande | Pilotage dégradé ou arrêt par prudence |
| Automates PLC | Injoignables depuis la supervision | Diagnostic et reprise plus lents |
| Alarmes | Non transmises ou retardées | Incident détecté trop tard |
| Historique | Données manquantes | Analyse qualité et traçabilité affaiblies |
| Accès distant | Maintenance impossible | Déplacement terrain obligatoire |
| Caméras IP | Perte de contrôle visuel | Surveillance réduite |
| Télérelève | Données non remontées | Facturation, reporting ou conformité perturbés |
Un réseau OT doit donc être pensé comme une infrastructure de disponibilité. La redondance ne sert pas uniquement à “avoir Internet”, mais à maintenir les fonctions critiques pendant la défaillance du lien principal.
Les Causes Fréquentes De Coupure Réseau OT
Les pannes réseau industrielles ont des origines variées. Certaines viennent de l’opérateur, d’autres du site lui-même.
-
Coupure fibre lors de travaux ou d’un incident de génie civil.
-
Panne de box, routeur, firewall ou modem.
-
Perte d’alimentation sur une baie réseau ou une armoire terrain.
-
Mauvaise qualité d’un lien ADSL, SDSL, radio ou 4G.
-
Saturation temporaire du lien principal.
-
Mauvaise configuration réseau après intervention.
-
Défaillance d’un switch industriel ou d’un convertisseur fibre.
-
Boucle réseau, tempête broadcast ou défaut de segmentation.
-
Maintenance opérateur non anticipée.
-
Incident cyber imposant l’isolement d’une partie du réseau.
La continuité réseau OT ne peut pas reposer sur un seul scénario. Elle doit surveiller la disponibilité réelle du service et basculer lorsque le lien principal ne remplit plus son rôle.
Architecture Recommandée Avec Failover LTE Dual SIM
Une architecture de failover LTE industriel place une gateway entre le réseau OT et les liens de sortie. Cette gateway surveille le lien principal, maintient un lien de secours mobile et applique une politique de basculement automatique.
Cette architecture permet de maintenir un chemin réseau lorsque le lien principal devient indisponible. Elle donne aussi aux équipes une preuve de ce qui s’est passé : heure de coupure, lien utilisé, durée de basculement, retour au nominal et qualité observée.
Notre Approche
La gateway Eziwan surveille en permanence la qualité du lien principal, qu’il s’agisse d’une fibre, d’un accès ADSL, SDSL, Ethernet opérateur ou autre lien WAN. Dès qu’un seuil de dégradation est détecté, elle peut basculer automatiquement vers un lien LTE de secours.
Le basculement peut être déclenché par plusieurs signaux.
-
Perte complète du lien principal.
-
Latence anormale.
-
Perte de paquets excessive.
-
Tunnel VPN indisponible.
-
Gigue trop élevée pour les usages sensibles.
-
Échec répété des sondes de disponibilité.
-
Dégradation durable au-delà d’un seuil défini.
Deux SIM associées à des opérateurs différents renforcent la redondance. Si le réseau mobile principal est indisponible ou dégradé, la gateway peut utiliser une seconde SIM. Pour les sites les plus critiques ou hors couverture mobile, un lien satellite, par exemple Starlink ou VSAT selon le contexte, peut être ajouté comme troisième niveau de secours.
Fonctionnalités Clés
Dual SIM Actif/Passif
Le Dual SIM actif/passif consiste à garder une SIM principale et une SIM secondaire prête à prendre le relais. Les deux cartes peuvent être associées à des opérateurs différents afin de réduire la dépendance à une seule infrastructure mobile.
Cette approche est particulièrement utile lorsque le site dépend d’un opérateur performant en temps normal, mais doit rester joignable en cas de panne locale, saturation ou maintenance réseau.
Basculement Transparent Pour Les Services Critiques
Le failover doit être aussi discret que possible pour les usages industriels. Selon les protocoles, la configuration VPN, les temporisations applicatives et les mécanismes de reconnexion, certaines sessions peuvent survivre au basculement ou se rétablir automatiquement.
L’objectif est de maintenir les fonctions critiques : alarmes, supervision, accès distant, remontée d’états, commandes autorisées et télémétrie prioritaire. Les flux moins urgents peuvent être ralentis ou suspendus pendant le fonctionnement sur LTE.
Sondes De Qualité Réseau
Une coupure franche est facile à détecter. Une dégradation progressive est plus dangereuse, car le lien semble encore actif alors que les applications deviennent instables.
Les sondes de qualité surveillent notamment :
-
La latence.
-
La gigue.
-
La perte de paquets.
-
L’état du tunnel VPN.
-
La disponibilité de cibles de référence.
-
La qualité radio LTE.
-
L’opérateur mobile actif.
Ces mesures permettent de basculer avant que la supervision ne devienne inutilisable.
Alertes Temps Réel
Les alertes doivent prévenir les bonnes personnes au bon moment. Une notification utile précise le site concerné, le lien en défaut, le lien de secours utilisé, l’heure de basculement, l’état du tunnel et la criticité.
Les canaux peuvent inclure :
-
Email.
-
SMS.
-
Webhook.
-
Supervision centralisée.
-
Ticket dans un outil ITSM.
-
Notification vers une équipe d’astreinte.
L’alerte au rétablissement est aussi importante que l’alerte à la coupure, car elle permet de confirmer le retour au nominal et d’analyser la durée réelle de l’incident.
Rapport De Disponibilité
Un rapport de disponibilité donne une vision factuelle des incidents réseau. Il peut servir aux équipes OT, à la DSI, au responsable maintenance, au responsable qualité ou au fournisseur d’accès.
Un bon rapport doit contenir :
-
Le nombre de basculements.
-
La durée cumulée sur lien de secours.
-
Les liens utilisés.
-
Les heures de coupure et de rétablissement.
-
Les causes détectées.
-
La qualité radio observée.
-
Les périodes de dégradation avant coupure.
-
Les événements récurrents par site.
Ces données aident à décider s’il faut changer d’opérateur, déplacer une antenne, ajouter un lien satellite, remplacer un routeur ou revoir la topologie réseau.
Compatibilité Avec Les Équipements IP Existants
Une gateway de continuité réseau doit s’intégrer sans imposer une refonte complète des équipements industriels. Elle peut fonctionner avec de nombreux équipements IP existants : SCADA, automates Siemens, Schneider ou Rockwell, caméras IP, IHM, serveurs d’historisation, switchs industriels, capteurs connectés, RTU et passerelles IoT.
L’enjeu est de préserver les flux utiles tout en évitant d’exposer directement les équipements OT à Internet.
Dégradation Gracieuse Configurable
Lorsqu’un site fonctionne sur LTE, il peut être nécessaire de réduire certains usages pour maîtriser la bande passante et les coûts data. La dégradation gracieuse consiste à maintenir les fonctions critiques et à déprioriser le reste.
Exemples de priorités :
-
Maintenir les alarmes critiques.
-
Maintenir les commandes nécessaires à l’exploitation.
-
Garder le tunnel VPN pour l’astreinte.
-
Réduire la fréquence de polling non urgent.
-
Suspendre certains flux vidéo.
-
Décaler les exports volumineux.
-
Limiter les mises à jour non critiques.
Cette logique transforme le lien LTE en vraie continuité de service, pas en simple secours best effort.
Support Satellite En Troisième Niveau
Pour les sites très isolés, la 4G ou la 5G ne suffisent pas toujours. Un port WAN Ethernet peut permettre l’ajout d’un modem satellite en troisième niveau de secours. Cette architecture tri-redondante convient aux sites où la perte de connectivité a un impact fort : eau, énergie, sécurité, télérelève critique, supervision de sites isolés ou exploitation multi-sites.
Le satellite doit toutefois être conçu comme un lien à part entière : visibilité du ciel, alimentation, fixation, latence, supervision, coût et règles de priorité doivent être validés.
Cycle De Basculement D’un Lien Industriel
Un failover efficace suit un cycle clair : surveillance, détection, qualification, basculement, supervision du mode secours, retour contrôlé.
Le retour au lien principal doit être maîtrisé. Si la fibre revient quelques secondes puis retombe, un retour trop rapide peut provoquer des oscillations. Il faut donc attendre une période de stabilité avant de revenir au nominal.
Quels Flux Prioriser Pendant Une Coupure
Tous les flux OT n’ont pas la même criticité. Un bon plan de continuité définit ce qui doit être maintenu pendant une coupure du lien principal.
| Flux | Priorité | Commentaire |
|---|---|---|
| Alarmes critiques | Très haute | À maintenir même en mode dégradé |
| Commandes d’exploitation | Haute | À limiter aux usages autorisés |
| Supervision SCADA | Haute | Polling ajustable selon bande passante |
| Accès distant maintenance | Moyenne à haute | Selon procédure d’astreinte |
| Historisation détaillée | Moyenne | Peut être réduite temporairement |
| Vidéo IP | Variable | Souvent coûteuse en débit |
| Exports batch | Basse | À reporter après rétablissement |
| Mises à jour | Basse | À bloquer pendant le secours |
Cette priorisation évite qu’un flux secondaire consomme le lien LTE au détriment des alarmes ou de la supervision essentielle.
Exemple De Politique De Failover
Une politique de failover doit être documentée et compréhensible par les équipes IT, OT et maintenance. Elle décrit les seuils, les liens de secours, les alertes et les règles de retour.
site:
nom: usine_ligne_conditionnement
criticite: haute
lien_principal:
type: fibre
surveillance:
latence_max: 250ms
perte_paquets_max: 5%
echec_sonde: 3
duree_degradation: 30s
secours:
lte:
mode: dual_sim
sim_1: operateur_a
sim_2: operateur_b
priorite:
- alarmes
- supervision
- acces_maintenance
satellite:
actif: optionnel
usage: dernier_recours
retour_nominal:
stabilite_requise: 10min
retour_automatique: true
alertes:
basculement: sms_email
degradation: email
retour_service: sms_email
rapport_mensuel: pdf
Les valeurs doivent être adaptées au site. Une station de pompage isolée, une ligne robotisée et un centre de supervision multi-sites n’ont pas les mêmes contraintes.
Mesurer Le MTTR Réseau OT
Le MTTR, ou temps moyen de rétablissement, est un indicateur essentiel. Dans un réseau industriel, il ne faut pas seulement mesurer le temps de réparation du lien principal, mais aussi le temps nécessaire pour maintenir ou retrouver le service.
On peut distinguer plusieurs temps.
| Indicateur | Définition | Objectif |
|---|---|---|
| Temps de détection | Délai entre incident et détection | Le plus court possible |
| Temps de basculement | Délai avant activation du secours | Compatible avec les applications |
| Temps de notification | Délai avant alerte équipe | Immédiat ou quasi immédiat |
| Temps de diagnostic | Délai pour identifier la cause | Réduit par les logs |
| Temps de réparation | Délai de retour du lien principal | Dépend du fournisseur |
| Temps de retour nominal | Délai avant retour contrôlé | Éviter les oscillations |
Le failover LTE ne répare pas la fibre coupée. Il réduit l’impact opérationnel pendant que la réparation suit son cours.
SLA, Disponibilité Et Continuité De Production
Un objectif de disponibilité, comme 99,9 % ou 99,97 %, ne doit pas être utilisé comme promesse générique sans contexte. Il dépend de l’architecture, des liens disponibles, de la couverture mobile, de l’alimentation, de la maintenance, des contrats opérateurs et de la supervision.
En revanche, une architecture redondante permet de construire une cible de service plus robuste qu’un lien unique.
| Architecture | Résilience attendue | Limite principale |
|---|---|---|
| Lien WAN unique | Faible | Toute panne coupe le site |
| WAN + LTE mono-SIM | Moyenne | Dépendance à un opérateur mobile |
| WAN + Dual SIM | Élevée | Dépendance à la couverture mobile |
| WAN + Dual SIM + satellite | Très élevée | Coût, latence et complexité |
| Multi-sites supervisés | Élevée si bien exploité | Nécessite des procédures claires |
La disponibilité réelle doit être mesurée dans le temps avec des rapports exploitables, pas seulement annoncée dans un contrat.
Sécurité : Assurer La Continuité Sans Exposer L’OT
Un lien de secours mal conçu peut introduire un risque cyber. Par exemple, un modem 4G branché directement sur un automate, avec une interface d’administration exposée, peut créer une porte d’entrée non maîtrisée.
Les bonnes pratiques de sécurité sont indispensables.
-
Aucun service OT exposé directement sur Internet.
-
Tunnel VPN chiffré vers une plateforme contrôlée.
-
Comptes nominatifs pour les accès distants.
-
Authentification forte lorsque l’accès humain est autorisé.
-
Segmentation entre réseau IT, DMZ et OT.
-
Filtrage des flux par destination et usage.
-
Journalisation des connexions et des basculements.
-
Révocation rapide des accès prestataires.
-
Supervision de la configuration et des événements.
Cette approche s’inscrit dans les principes de défense en profondeur utilisés en cybersécurité industrielle, notamment dans les démarches inspirées de l’IEC 62443.
Failover LTE Et IEC 62443
L’IEC 62443 ne se résume pas à la disponibilité réseau. Elle traite plus largement de la cybersécurité des systèmes industriels : zones, conduits, exigences de sécurité, gestion des risques, durcissement et gouvernance. Un failover LTE peut contribuer à cette démarche, mais il ne rend pas une infrastructure conforme à lui seul.
Il peut aider sur plusieurs points techniques.
-
Séparation des zones et conduits réseau.
-
Maîtrise des accès distants.
-
Journalisation des événements de connectivité.
-
Réduction de l’exposition directe des équipements OT.
-
Maintien de certaines fonctions critiques en cas d’incident réseau.
-
Documentation des flux et des dépendances.
La conformité doit toujours être évaluée à l’échelle du système complet : architecture, procédures, utilisateurs, maintenance, fournisseurs et preuves d’exploitation.
Cas D’usage Industriels
Usine Avec SCADA Centralisé
Une usine qui supervise plusieurs lignes depuis un SCADA centralisé dépend fortement de la disponibilité réseau. En cas de coupure du lien principal, le failover LTE maintient la visibilité sur les alarmes et les états critiques, le temps que le lien nominal soit rétabli.
Station De Pompage Ou Site Eau
Les sites d’eau potable et d’assainissement sont souvent répartis sur un territoire large. La continuité réseau permet de maintenir la remontée d’alarmes, les niveaux, les défauts variateurs, les états de pompes et les informations nécessaires à l’astreinte.
Production Énergétique
Une centrale solaire, un poste de livraison ou une unité de stockage doit transmettre ses données de production, défauts onduleurs, alarmes et états de disponibilité. Un lien de secours réduit le risque de perte de supervision pendant une panne opérateur.
Site Logistique Ou Entrepôt Automatisé
Dans un entrepôt automatisé, le réseau relie WMS, convoyeurs, automates, capteurs, supervision et parfois caméras. Une coupure peut ralentir ou bloquer les flux physiques. La redondance réseau aide à maintenir les fonctions prioritaires.
Machine Spéciale Chez Un Client
Un constructeur de machines peut équiper ses installations d’une gateway avec lien de secours afin de conserver un accès de maintenance sécurisé. Cela réduit les déplacements et accélère le diagnostic lorsque le réseau client est indisponible ou instable.
Checklist Avant Déploiement
Avant de mettre en production un failover LTE industriel, il faut valider les points essentiels.
| Contrôle | Question | Priorité |
|---|---|---|
| Cartographie | Les équipements et flux critiques sont-ils identifiés ? | Haute |
| Couverture mobile | Deux opérateurs sont-ils testés sur site ? | Haute |
| Antennes | L’emplacement garantit-il une qualité radio suffisante ? | Haute |
| Alimentation | La gateway et les équipements réseau sont-ils secourus ? | Haute |
| Seuils | Les critères de basculement sont-ils définis ? | Haute |
| Priorisation | Les flux critiques sont-ils prioritaires en LTE ? | Haute |
| Sécurité | Les services OT ne sont-ils pas exposés directement ? | Haute |
| Logs | Les basculements sont-ils journalisés ? | Haute |
| Alertes | Les bonnes équipes sont-elles notifiées ? | Haute |
| Retour | Le retour au lien principal est-il contrôlé ? | Moyenne |
| Tests | Un exercice de coupure a-t-il été réalisé ? | Haute |
Le test de coupure est indispensable. Une architecture de secours non testée reste une hypothèse.
Erreurs Fréquentes À Éviter
Ajouter Un Modem 4G Sans Supervision
Un modem 4G isolé peut dépanner ponctuellement, mais il ne donne pas toujours de visibilité sur les basculements, la qualité radio, les consommations data ou les incidents récurrents.
Utiliser Le Même Opérateur Pour Tous Les Liens
Si le lien principal et le lien mobile dépendent du même opérateur ou de la même infrastructure locale, la redondance peut être moins efficace. Il faut rechercher une indépendance réelle lorsque le site est critique.
Ne Pas Prioriser Les Flux
En cas de basculement LTE, certains flux peuvent saturer le lien : vidéo, sauvegardes, exports, mises à jour ou synchronisations massives. Sans priorisation, les alarmes et la supervision peuvent être pénalisées.
Oublier L’alimentation Électrique
Un failover réseau ne sert à rien si la gateway, le switch ou l’antenne active ne sont plus alimentés. Les équipements de continuité doivent être raccordés à une alimentation secourue lorsque la criticité l’exige.
Revenir Trop Vite Au Lien Principal
Un lien principal instable peut provoquer des allers-retours entre WAN et LTE. Il faut définir une période de stabilité avant retour au nominal.
Comment Eziwan Aide À Réduire Le Risque D’arrêt
Eziwan centralise la continuité réseau OT autour d’une gateway supervisée, capable de surveiller les liens, basculer vers LTE, utiliser deux SIM, notifier les équipes et produire des rapports.
| Besoin | Réponse Eziwan | Bénéfice |
|---|---|---|
| Coupure fibre ou xDSL | Basculement automatique vers LTE | Maintien des fonctions critiques |
| Panne opérateur mobile | Dual SIM avec opérateurs distincts | Redondance renforcée |
| Diagnostic difficile | Logs et historique des événements | Analyse plus rapide |
| Supervision dégradée | Alertes temps réel | Réaction immédiate |
| Sites isolés | Antennes adaptées et satellite optionnel | Couverture étendue |
| Coûts data | Dégradation gracieuse configurable | Priorisation des flux essentiels |
| Audit fiabilité | Rapport de disponibilité | Preuve d’exploitation |
Cette continuité peut être combinée avec la gateway Eziwan, la supervision via le cloud Eziwan et les architectures de connectivité industrielle.
Plan De Test Recommandé
Une fois la solution installée, il faut valider le fonctionnement avec un test contrôlé.
Le test doit vérifier la remontée d’alarme, le comportement du SCADA, la disponibilité des automates, les notifications, les logs et le retour au lien principal. Il doit être réalisé dans une fenêtre maîtrisée, avec les équipes concernées.
Conclusion
Une coupure réseau industrielle peut devenir un arrêt de production lorsque le SCADA, les automates, les alarmes et les accès distants dépendent d’un lien unique. Le failover LTE Dual SIM réduit ce risque en ajoutant un chemin de secours automatique, supervisé et exploitable.
La valeur d’une solution comme Eziwan ne se limite pas au modem 4G. Elle vient de l’ensemble : surveillance de la qualité réseau, basculement automatique, Dual SIM, alertes temps réel, rapports de disponibilité, priorisation des flux et intégration avec une architecture OT sécurisée. Pour les sites industriels critiques, cette approche transforme la continuité réseau en mécanisme maîtrisé plutôt qu’en réaction d’urgence.
Pour aller plus loin
- Backup 4G industriel — activez automatiquement un lien 4G de secours en cas de coupure fibre
- Redondance internet industrielle — architectures de redondance pour garantir la continuité de production
- Connectivité industrielle — comparez les technologies de connectivité pour vos sites industriels
- Routeur 4G industriel — routeurs industriels avec failover automatique et Dual SIM intégré
- Routeur LTE industriel — routeurs LTE hautes performances pour environnements industriels critiques