"Je crains que la plateforme s'emballe et qu'on sache pas où regarder."
C'est la réponse de mon client quand j'ai demandé ce qui l'empêchait de dormir à l'approche du plus gros projet de l'année.
Ce client-là organise des événements. Sa Joconde c'est 25 000 participants sur 2 semaines non-stop.
La plateforme avait trébuché sur les 3 dernières éditions : un coup le scaling, un coup les caches, un coup Redis.
2026 arrivait avec une migration d'hébergeur, une feature risquée, et une refonte mobile dans les valises.
L'équipe avait les connaissances produit et l'envie requises pour mener leurs propres tests de charge. Ce qui manquait, c'était le cadre méthodologique.
À leur échelle, soit tu raques pour du spécialiste qui va s'installer des semaines, soit tu navigues à vue jusqu'au crash en prod.
J'ai proposé une troisième voie : un atelier de cadrage d'une après-midi. Je réunis tout le monde dans un bocal et on mélange les jus de cerveaux.
On a isolé LE parcours critique, 80% du trafic et 100% des incidents. On a posé les SLOs, fait un plan, identifié les risques…
4 heures plus tard, on est sortis de là en se serrant la pince.
L'équipe a déroulé au poil : observabilité activée, scripts k6, sanity check, test nominal, puis de stress à ×2.4. Les tests ont révélé les anomalies et Elastic APM leur a donné de quoi corriger avant que la clientèle foute le feu.
Évidemment, l'événement n'a pas été sans accroc, mais l'essentiel est là. 99% des temps en dessous d'1 seconde.
Bilan des courses : 1 après-midi de cadrage pour mettre fin à 3 ans de stress.
Publié à l'origine sur LinkedIn.
Voir le post sur LinkedIn →