Un runbook de production pour mesurer la cardinalité des dimensions, contenir le bruit, canaryer un regroupement stable et rollbacker une alerte Azure Monitor sans perdre la couverture.
Un runbook de production pour qualifier le tail sampling OpenTelemetry avec affinité des traces, spans tardifs, pression mémoire, couverture des règles, preuves Azure Monitor, canari et rollback.
Un runbook de production pour isoler métrique, target et labels responsables d’une hausse de séries AKS avant de filtrer la collecte, demander plus de capacité ou rollbacker.
Un runbook de production pour séparer endpoint de santé défectueux, instance dégradée, redirection, authentification et panne de dépendance avant de redémarrer ou modifier Health Check.
Un runbook de production pour qualifier une perte de logs après modification d’une Data Collection Rule, séparer source, stream, transformation KQL et destination, puis valider ou rollbacker avec un canary.
Un runbook de production pour classer les messages en dead-letter, prouver la cause, vérifier l'idempotence et rejouer par canari sans créer une seconde panne.
Un runbook de production pour séparer pression d’ingestion, throttling, partition chaude, panne du consumer et dérive de checkpoint avant d’augmenter la capacité ou de rejouer des événements.
Un runbook de production pour isoler AMPLS, DCE, DCR, DNS, associations et Azure Monitor Agent quand la télémétrie disparaît après un durcissement réseau, puis valider ou rollbacker sans rouvrir largement l’accès public.
Un runbook de production pour construire et qualifier une alerte de burn rate dans Azure Monitor en séparant SLI, budget d’erreur, fenêtres courte et longue, qualité des logs, notification, validation et rollback.
Un runbook de production pour canaryer une transformation KQL dans une Data Collection Rule, comparer volumes et schémas, détecter les rejets puis valider ou rollbacker sans trou d'observabilité.
Un runbook de production pour qualifier une dérive Azure Workbooks avec KQL, Log Analytics, Application Insights, dimensions, latence d'ingestion, validation et rollback avant de modifier les alertes ou tableaux de bord.
Un runbook de production pour qualifier une perte apparente de telemetrie Application Insights avec sampling, ingestion, SDK, KQL, alertes, validation et rollback avant de modifier les seuils.
Un runbook de production pour qualifier un Action Group Azure Monitor en séparant règles, canaux, webhooks, escalades, preuves KQL, validation et rollback avant de réduire les notifications.
Un runbook de production pour qualifier une alerte Azure Monitor qui arrive trop tard en séparant horodatage applicatif, ingestion Log Analytics, requête KQL, fenêtre d'évaluation, action group, validation et rollback.
Un runbook de production pour qualifier un dashboard ou une alerte Azure Managed Grafana avec datasource Azure Monitor, identité managée, droits Log Analytics, variables, traces, validation et rollback avant de modifier les requêtes KQL.
Un runbook de production pour qualifier une alerte Azure Monitor déclenchée sans notification, avec Action Groups, receivers, règles de traitement, webhooks, preuves, validation et rollback.
Un runbook de production pour qualifier une disparition de logs Azure Monitor avec Diagnostic Settings, DCR, ingestion, KQL, coûts, validation et rollback avant de modifier les alertes.
Un runbook de production pour décider un rollback Azure après déploiement avec Azure Monitor, KQL, corrélation d'impact, preuve de régression, validation et retour arrière contrôlé.
Un runbook de production pour qualifier une vague d'alertes Azure Monitor après un déploiement en séparant signal réel, bruit, régression, changement de seuil, action group et rollback.