Un runbook de production pour qualifier un signal Azure Service Health ou Resource Health avec impact utilisateur, dépendances, routage, DNS, observabilité, décision de failover et rollback.
Un runbook de production pour qualifier un Action Group Azure Monitor en séparant règles, canaux, webhooks, escalades, preuves KQL, validation et rollback avant de réduire les notifications.
Un runbook de production pour qualifier les 429 Cosmos DB avec consommation RU, partitions chaudes, forme des requêtes, retries SDK, indexation, preuves KQL, décision de scaling et rollback.
Un runbook de production pour qualifier une alerte Azure Monitor déclenchée sans notification, avec Action Groups, receivers, règles de traitement, webhooks, preuves, validation et rollback.
Un runbook de production pour qualifier un job AWX en échec avec événements Ansible, tâches changed, hôtes touchés, variables, relance limitée, validation et rollback.
Un runbook de production pour qualifier une action d'agent IA avec traces, sources, outils, identité, KQL, validation humaine et rollback sans couper toute l'assistance.
Un runbook de production pour décider un rollback Azure après déploiement avec Azure Monitor, KQL, corrélation d'impact, preuve de régression, validation et retour arrière contrôlé.
Un runbook de production pour qualifier une vague d'alertes Azure Monitor après un déploiement en séparant signal réel, bruit, régression, changement de seuil, action group et rollback.
Construire des alertes exploitables en reliant signal, diagnostic, périmètre, décision et action de retour arrière, au lieu d’accumuler des notifications peu utiles.