Quand faut-il arrêter un service informatique et comment préparer son redémarrage ?
D’après Gestion des incidents
Arrêt contrôlé : savoir couper pour sauver
Couper un service critique est un acte lourd, mais salutaire : risque d’intégrité des données, compromission non bornée, escalade de propagation, exposition réglementaire imminente.
La CCE statue à partir d’un faisceau d’indices : preuves techniques, probabilités, impacts métier, alternatives.
L’arrêt est procéduré : annonce interne, suspension ordonnée des flux, gel des jobs batch, purge contrôlée des files, sauvegardes, scellés de preuve.
On fixe des seuils de reprise (prérequis techniques, contrôles d’intégrité, validation métier) et un point de revue.
Un arrêt mal piloté détruit la preuve, double le temps de reprise et coûte la confiance.
Un arrêt maîtrisé raccourcit la crise et préserve l’essentiel.
Le courage consiste à assumer la décision tôt, au bon périmètre, et à financer immédiatement les mesures de compensation côté clients.
Redémarrage prudent : conditions, séquencement, sentinelles
Redémarrer trop tôt produit des rechutes coûteuses.
La CCE définit des conditions d’entrée en redémarrage : surfaces compromises nettoyées ou reconstruites, intégrité des données vérifiée, identités et secrets assainis, dépendances tierces garanties, observabilité renforcée.
Le séquencement suit la chaîne de valeur : socles (identité, réseau, secrets), données maîtres, parcours critiques, périphériques.
On installe des sentinelles pour détecter les dérives dès l’ouverture.
Les métiers valident des jeux de boutenbout et des contrôles de cohérence.
La communication externe reste prudente : messages factuels, promesses mesurées, assistance renforcée.
La réussite n’est pas l’instant T de remise en ligne (ça c’est facile), c’est la stabilité sur 48 à 72 heures sans régression majeure.
