Tes perf varient de 10% d'un test à l'autre. T'as pas d'observabilité ? Dommage.
Sans observabilité, impossible d'expliquer le problème, impossible d'enquêter, impossible de poser les bonnes questions. D'ailleurs il est très probable que tu saches pas vraiment comment ton système fonctionne.
Après toute cette sueur et tout cet argent dépensé, y'a de quoi être crispé.
On se montre nos cicatrices ? Tiens, regarde celle-là :
Janvier 2025. Environnement de test béton : hardware dédié, tests automatisés quotidiens, système stable depuis des années.
L'exigence (SLO) dit qu'à +5% de temps de réponse moyen on commence à froncer les sourcils et on sort la loupe.
Le détail qui tue : la moyenne est à 47 MILLISECONDES. Si je perds 2 ms, je dois trouver un coupable.
Je me connecte un mardi, et on me dit "Matthieu, on a un problème, regarde ça". Régression de 5 millisecondes. Je relance le même test sur la même version → 47 ms, 52 ms, 49 ms…
Alors je surveille absolument tout. Fréquences, interruptions, états d'alimentation, température CPU, âge du capitaine…
Et là, un pattern émerge : tous mes tests s'améliorent à exactement 45°C.
45°C. Pile.
Sans observabilité, j'avais un symptôme. Avec, j'ai pas encore une explication mais j'ai une piste.
Faire du test de charge sans observabilité, c'est aller chez le médecin en disant "j'ai mal" et refuser la radio.
Tu sais que ça va pas. Tu sais pas pourquoi. Et tu rentres chez toi avec du Doliprane.
Tes tests te disent quoi. Ton observabilité te dit POURQUOI.
L'un sans l'autre, tu brasses du vent.
Publié à l'origine sur LinkedIn.
Voir le post sur LinkedIn →