QUESTIONS & RÉPONSES La collection de Solve DSI - Yann-Eric Devars
← Revenir aux réponses

Que faut-il savoir sur « SRE, SLI/SLO et observabilité, donner du sens métier aux signaux techniques » ?

Extrait de Gestion des incidents

Le SRE part d’une idée simple.Définir combien d’imperfection votre service peut encaisser avant de ralentir les métiers dabs leur travail et leur performance.C’est le budget d’erreur.Il transforme la fiabilité en contrat opératoire entre produit, métier et technique.

Les SLI décrivent ce que ressent l’utilisateur.Disponibilité perçue, latence de bout en bout, taux d’erreurs, fraîcheur des données.Les SLO fixent les objectifs acceptables dans une fenêtre donnée.

Mensuelle pour des services client, quotidienne pour des parcours critiques, horaire pour des API temps réel.Quand le budget d’erreur fond, on décide.Gel de déploiements, roll-back ciblé, activation d’un mode dégradé, ouverture d’une war-room.

L’observabilité relie les points.Logs, métriques et traces racontent l’histoire d’une requête.

Ajoutez des événements métier, commande créée, paiement refusé, dossier clôturé.Les signaux techniques prennent sens et deviennent des décisions.

Visez peu d’indicateurs, bien placés.Un SLI par étape clé du parcours, une alerte par risque majeur, une page d’état lisible.Rédigez la règle de décision attachée à chaque alerte.Qui regarde, que fait-on, dans quel délai.Mesurez la latence de détection et la latence de qualification.Ce sont vos vrais objectifs temps.

Évitez les tableaux décoratifs et la collecte tous azimuts.Trop de bruit use la vigilance, trop peu de contexte rallonge l’enquête.Investissez dans le traçage distribué, dans l’échantillonnage intelligent, dans des logs frugaux mais probants.

Une observabilité bien conçue n’élimine pas l’incident.Elle évite de s’y noyer.Elle donne un langage commun, elle cadre des arbitrages explicites, elle réduit le temps d’incertitude.

C’est ainsi que la fiabilité cesse d’être une promesse et devient une habitude.