Trois matières premières
Les logs racontent les événements : telle requête a échoué, tel traitement s'est terminé, tel utilisateur n'a pas pu payer. Les métriques comptent : temps de réponse, taux d'erreur, consommation mémoire, nombre de commandes par minute. Les traces suivent une requête de bout en bout à travers les composants traversés, et montrent où le temps est passé.
Prises séparément, elles donnent des indices. Ensemble, elles permettent de reconstituer une histoire : le pic d'erreurs de 14h02 vient d'un service tiers dont le temps de réponse a triplé, ce qui a saturé la file d'attente. C'est cette capacité à répondre à une question qu'on n'avait pas anticipée qui distingue l'observabilité du simple monitoring.
Le vrai indicateur : le temps de résolution
Une alerte qui dit « le site est lent » ne sert presque à rien : l'équipe passe l'heure suivante à chercher où regarder. Une alerte qui dit quel service, quelle requête et depuis quand transforme cette heure en dix minutes. C'est là que se mesure le retour sur investissement, sur la durée de l'incident bien plus que sur sa détection.
Il y a un bénéfice moins visible mais durable : les incidents évités. Une consommation mémoire qui monte régulièrement, un traitement nocturne qui déborde, un taux d'erreur qui grimpe de façon discrète, ce sont des pannes qui se voient venir plusieurs jours à l'avance quand on a les bonnes courbes.
Mettre en place sans se noyer
L'écueil classique est de tout collecter puis de ne rien regarder, avec une facture de stockage à la clé. La démarche efficace part des parcours qui comptent pour le métier : le tunnel de commande, la connexion, le traitement de facturation. On instrumente ces chemins, on définit ce qui est anormal, et on ne déclenche d'alerte que sur ce qui exige une action humaine.
C'est aussi ce qui permet de piloter la scalabilité avec des chiffres plutôt qu'avec des intuitions, et ce qui donne du sens à un contrat de TMA : sans mesure partagée, un engagement de rétablissement reste une déclaration. Voir notre approche de l'observabilité et du monitoring.




