Quelles erreurs techniques éviter dans le déploiement d’un site de secours ?
D’après Plan de reprise d’activité
Améliorations
Automatisation d’un script Terraform pour recréer certains composants en cas de corruption,
Ajout d’alertes courriel si la réplication a plus de 30 minutes de retard.
Pièges
Site de secours sous-dimensionné : le jour J, impossible de supporter la charge ou de stocker toutes les données répliquées.
Réplication non testée : on découvre qu’elle ne fonctionne plus depuis des semaines.
Configuration réseau incomplète : DNS pas à jour, VPN mal configuré, on ne peut pas atteindre le site de secours ou le trafic est bloqué.
Pas de patch : le site de secours est obsolète, vulnérable, n’a pas reçu les mêmes mises à jour que le site principal.
Oubli des licences : certains logiciels doivent être réactivés ou n’autorisent pas la duplication sur un autre site.
Bonnes pratiques
Planifier la capacité : CPU, RAM, stockage, bande passante, en prenant une marge pour la croissance future.
Script d’automatisation : réduire les erreurs humaines, accélérer la bascule, clarifier la séquence de redémarrage.
Documentation à jour : toute modification d’IP, d’architecture, de versions logicielles doit être reportée dans le PRA.
Sécurité renforcée : cloisonnement, chiffrement, authentification forte, monitoring.
Exercices réguliers : tester la restauration et la bascule au moins une fois par an (ou plus selon la criticité).
