Cloud 2 notes
Application Gateway retourne un 502
Séparer health probe, résolution DNS, paramètres TLS et joignabilité réseau privée avant de modifier l’application.
Premiers contrôles - Vérifier l’état de santé backend
- Résoudre le nom backend depuis le chemin gateway
- Valider TLS/SNI et la configuration de probe
- 01 Azure Application Gateway : diagnostiquer les erreurs 502 sans mélanger DNS, TLS et backend health
- 02 Azure Private Endpoint : construire une matrice de validation avant la mise en production
Cloud 4 notes
APIM interne retourne une erreur sur une API privée
Corréler les logs Application Gateway/WAF et APIM, puis séparer DNS, TLS, policy, identité et joignabilité backend privée avant de modifier les policies ou rouvrir les accès.
Premiers contrôles - Vérifier si le WAF a bloqué la requête
- Confirmer qu’APIM reçoit le même chemin
- Valider DNS et TLS backend depuis le chemin APIM
- Rejouer avec un identifiant de corrélation
- 01 APIM interne Azure : diagnostiquer une API privée avant de modifier les policies
- 02 Snippet KQL : corréler WAF et APIM sur une API privée Azure
- 03 Azure Application Gateway : diagnostiquer les erreurs 502 sans mélanger DNS, TLS et backend health
- 04 Azure APIM : diagnostiquer le TLS backend avant de désactiver la validation du certificat
Networking 4 notes
Un nom Private Endpoint résout encore en public
Confirmer la chaîne CNAME, l’association Private DNS Zone et le forwarding hybride depuis le réseau consommateur.
Premiers contrôles - Lancer nslookup depuis le réseau workload
- Vérifier le CNAME privatelink
- Contrôler les liens Private DNS Zone et forwarders
- 01 Snippet Azure : vérifier la résolution DNS d’un Private Endpoint
- 02 Snippet Azure : repérer un drift DNS Private Endpoint
- 03 DNS hybride Azure : quand utiliser Private Resolver, forwarders on-premises et zones privées
- 04 Azure Private Endpoint : détecter le drift Terraform, DNS et réseau avant incident
Cloud 3 notes
Un endpoint privé Azure Storage retourne 403, timeout ou aucun log de requête
Séparer DNS du sous-service Storage, approbation Private Endpoint, règles firewall, identité runtime et logs Storage avant d’ouvrir l’accès public ou d’élargir RBAC.
Premiers contrôles - Résoudre le sous-service Storage exact depuis le réseau workload
- Vérifier statut Private Endpoint et private DNS zone group
- Rejouer avec un client request ID
- Corréler les logs Storage pour 403, IP appelante et identité requérante
- 01 Azure Storage : diagnostiquer un endpoint privé sans ouvrir le compte
- 02 Snippet KQL : isoler les 403 Azure Storage sur endpoint privé
- 03 Azure Private Endpoint : détecter le drift Terraform, DNS et réseau avant incident
Cloud 3 notes
Un endpoint privé Azure SQL retourne timeout, erreur firewall ou aucun log SQL
Séparer DNS privé SQL, état Private Endpoint, accès public, règles firewall, identité runtime et diagnostics SQL avant de modifier schéma, code ou droits trop larges.
Premiers contrôles - Résoudre le FQDN SQL depuis le réseau workload
- Vérifier le statut Private Endpoint et les enregistrements privatelink.database.windows.net
- Rejouer avec l’identité runtime réelle
- Corréler les diagnostics SQL pour firewall et erreurs de login
- 01 Azure SQL : diagnostiquer un endpoint privé avant de modifier la base
- 02 Snippet KQL : isoler les erreurs Azure SQL sur endpoint privé
- 03 Azure Private Endpoint : détecter le drift Terraform, DNS et réseau avant incident
Cloud 3 notes
Un endpoint privé Azure Service Bus timeout, refuse l’accès ou laisse le backlog monter
Séparer DNS privé Service Bus, état Private Endpoint, accès public, identité managée ou SAS, métriques de queue et logs de traitement avant de modifier les queues ou redéployer les consumers.
Premiers contrôles - Résoudre le FQDN Service Bus depuis le réseau workload
- Vérifier approbation Private Endpoint et accès public
- Contrôler l’identité réelle sender ou receiver
- Corréler backlog, dead-letter et erreurs Service Bus
- 01 Azure Service Bus : diagnostiquer un endpoint privé avant de toucher aux queues
- 02 Snippet KQL : isoler les erreurs Service Bus sur endpoint privé
- 03 Azure Private Endpoint : détecter le drift Terraform, DNS et réseau avant incident
Cloud 4 notes
Une probe synthétique échoue sur un chemin privé Azure
Séparer DNS, TLS, health Application Gateway, blocages WAF et réseau du runner avant de modifier le routage ou le code applicatif.
Premiers contrôles - Résoudre le hostname depuis le réseau de probe
- Contrôler TLS/SNI avec le vrai hostname
- Corréler le run de probe avec les logs WAF et gateway
- 01 Azure : rendre les chemins privés vérifiables avec des probes synthétiques
- 02 Snippet KQL : suivre les probes synthétiques d’un chemin privé Azure
- 03 Azure Application Gateway : diagnostiquer les erreurs 502 sans mélanger DNS, TLS et backend health
- 04 Azure Private Endpoint : détecter le drift Terraform, DNS et réseau avant incident
Networking 5 notes
Un trafic Azure sort par un chemin et revient par un autre
Comparer cible DNS, routes effectives, associations de route table, preuves firewall, identité NAT et chemin retour avant de modifier les UDR ou contourner l’inspection.
Premiers contrôles - Résoudre la destination depuis le chemin source
- Comparer les routes effectives des NIC source et destination
- Contrôler les logs firewall ou appliance dans les deux sens
- Confirmer NAT ou identité source sortante
- 01 Azure : diagnostiquer un routage asymétrique avant de changer une UDR
- 02 Azure UDR : diagnostiquer un trou noir vers une NVA avant de modifier les routes
- 03 Azure NSG, UDR et Firewall : diagnostiquer un trafic bloqué avant d'ajouter une règle
- 04 Azure Firewall : diagnostiquer une règle masquée avant d’ouvrir le trafic
- 05 Azure UDR et NAT Gateway : diagnostiquer l'egress avant d'ouvrir le firewall
Cloud 3 notes
L’ingress privé Azure Container Apps échoue ou atteint la mauvaise révision
Séparer DNS privé, passage Application Gateway, mode d’ingress Container Apps, trafic des révisions et logs console avant rollback ou changement de poids.
Premiers contrôles - Résoudre le hostname depuis le réseau appelant
- Vérifier target port ingress et révisions actives
- Corréler logs system et console
- 01 Azure Container Apps : diagnostiquer un ingress privé avant de changer les révisions
- 02 Snippet KQL : diagnostiquer ingress privé et révisions Container Apps
- 03 Azure : rendre les chemins privés vérifiables avec des probes synthétiques
Cloud 3 notes
L’ingress privé AKS retourne 502 ou ne trouve aucun endpoint de service
Séparer DNS privé, health Application Gateway, routage ingress controller, selectors de service Kubernetes, endpoint slices et readiness des pods avant de rollback un déploiement.
Premiers contrôles - Résoudre le hostname depuis le réseau appelant
- Vérifier backend health Application Gateway et host header
- Contrôler ingress, service et endpoint slices
- Corréler logs controller et applicatifs
- 01 Azure AKS : diagnostiquer un ingress privé avant de changer les déploiements
- 02 Snippet KQL : corréler ingress privé AKS et logs applicatifs
- 03 Azure Application Gateway : diagnostiquer les erreurs 502 sans mélanger DNS, TLS et backend health
Infrastructure 1 note
Un upgrade de node pool AKS reste bloqué au drain d’un pod protégé par un PDB
Séparer replicas indisponibles, échecs de readiness, placement des pods, capacité de surge et PodDisruptionBudget trop contraignant avant de supprimer le garde-fou ou forcer l’upgrade.
Premiers contrôles - Capturer le nœud bloqué et les événements d’éviction
- Lire disruptionsAllowed et les selectors du PDB
- Vérifier capacité de remplacement, readiness et topologie des replicas
- Reprendre uniquement avec une marge de disruption positive
- 01 Azure AKS : débloquer un upgrade de node pool arrêté par un PDB
Cloud 3 notes
Un endpoint HTTP privé Azure Functions retourne 403, 503 ou aucun log de requête
Séparer DNS privé, joignabilité Private Endpoint, restrictions d’accès, état runtime Functions, storage privé et preuves Application Insights avant de redéployer le code ou rouvrir l’accès public.
Premiers contrôles - Résoudre le hostname depuis le réseau appelant
- Rejouer avec un identifiant de corrélation
- Vérifier access restrictions et statut Private Endpoint
- Corréler requests, traces et exceptions
- 01 Azure Functions : diagnostiquer un endpoint HTTP privé avant de changer le code
- 02 Snippet KQL : corréler endpoint HTTP privé Azure Functions
- 03 Azure : rendre les chemins privés vérifiables avec des probes synthétiques
Cloud 5 notes
Azure WAF bloque une requête légitime
Partir des requêtes bloquées, du ruleId et de l’URI avant de choisir exclusion, custom rule ou correction applicative.
Premiers contrôles - Lister les URI bloquées en KQL
- Identifier ruleId et champ matché
- Valider le périmètre du faux positif
- 01 Snippet KQL : lister rapidement les URI bloquées par Azure WAF
- 02 WAF et KQL : identifier un faux positif avant de créer une exclusion
- 03 Azure WAF : ajouter une exclusion OWASP/CRS sans affaiblir toute la protection
- 04 Azure WAF : encadrer une règle custom d’urgence sans perdre la preuve
- 05 Snippet Azure : auditer les priorités des custom rules WAF
Automation 4 notes
Le state lock Terraform reste bloqué
Prouver qu’aucun apply n’est encore actif avant force-unlock, puis repartir sur un plan propre.
Premiers contrôles - Identifier le propriétaire du lock
- Contrôler le statut du job CI
- Relancer un plan après unlock
- 01 Snippet Terraform : diagnostiquer un state lock bloqué avant force-unlock
- 02 Terraform Azure : sécuriser le backend state privé sans casser la CI
- 03 Terraform sur Azure : diagnostiquer un apply partiel avant de relancer la production
- 04 Terraform sur Azure : contenir des applies concurrents avant la divergence du state
Infrastructure 2 notes
Azure Monitor déclenche une tempête d’alertes après déploiement
Séparer impact réel, dimensions bruyantes, dérive de seuil, comportement d’action group et rollback avant de couper les notifications ou modifier les règles.
Premiers contrôles - Grouper les alertes par règle et cible
- Comparer la première alerte avec la fenêtre de déploiement
- Lire les logs du service avant de changer les seuils
- Garder une alerte de symptôme utilisateur active
- 01 Azure Monitor : diagnostiquer une tempête d'alertes après déploiement
- 02 Monitoring : transformer une alerte en runbook d’exploitation actionnable
Infrastructure 8 notes
Une rotation de secret, une identité fédérée ou un changement d’identité managée casse un consommateur applicatif ou CI
Séparer préparation, bascule, révocation, fédération d’identité workload et diagnostic d’identité managée ; valider l’identité réelle d’exécution, le chemin privé et les erreurs d’authentification avant de supprimer l’ancienne valeur ou d’élargir l’accès.
Premiers contrôles - Lister les consommateurs réels
- Vérifier l’identité runtime et la lecture du coffre
- Contrôler les claims OIDC ou le DNS privé selon le chemin
- Surveiller les 401/403/500, échecs de sign-in ou refus Key Vault
- 01 Rotation des secrets et identités de service : un runbook de production, pas une tâche isolée
- 02 Snippet KQL : repérer les erreurs d’authentification après rotation d’un secret
- 03 Identité managée Azure : diagnostiquer l’accès privé avant de changer les droits
- 04 Snippet KQL : diagnostiquer un refus Key Vault avec identité managée
- 05 Azure Workload Identity Federation : diagnostiquer l'auth CI avant de réintroduire un secret
- 06 Azure DevOps WIF : diagnostiquer une dérive d'issuer ou de subject avant de réintroduire un secret
- 07 Azure Managed Identity : diagnostiquer une dérive de principal après recréation
- 08 Azure Managed Grafana : diagnostiquer un accès API refusé avant de recréer un jeton
Automation 1 note
Une poison queue Azure Functions continue de grossir
Séparer défaut de contrat, dépendance transitoire, identité, pression de ressources et effet partiel avant de rejouer des messages Storage Queue.
Premiers contrôles - Échantillonner sans consommer les messages
- Corréler message IDs, invocations et dépendances
- Vérifier état aval et idempotence avant rejeu
- 01 Azure Functions : diagnostiquer une poison queue avant de rejouer les messages
Cloud 1 note
Une dead-letter queue Azure Service Bus continue de grossir
Classer les raisons de dead-letter, corréler les preuves consumer et aval, vérifier l’idempotence, puis imposer manifeste, canari et critères d’arrêt avant rejeu.
Premiers contrôles - Figer la queue ou subscription exacte et la fenêtre de croissance
- Échantillonner sans consommer, par raison de dead-letter
- Contrôler erreurs consumer, pertes de lock et état aval
- Prouver l’idempotence avant un canari d’un message
- 01 Azure Service Bus : diagnostiquer la dead-letter queue avant un rejeu borné
Automation 1 note
Une remédiation Azure Policy modifie des ressources de production inattendues
Figer définition et affectation, matérialiser les cibles éligibles, vérifier l’identité managée, puis utiliser un canary et des lots bornés avant d’élargir ou de compenser.
Premiers contrôles - Identifier la référence de définition et les paramètres d’affectation
- Exporter les identifiants des cibles non conformes
- Revoir l’identité d’affectation et son scope RBAC effectif
- Corréler les déploiements de remédiation avec l’Activity Log
- 01 Azure Policy : borner une tâche de remédiation avant de réécrire la production
Automation 2 notes
Une automatisation ressemble à une console distante
Borner les entrées, templates et dépôts avant d’exposer des opérations à plus d’utilisateurs.
Premiers contrôles - Lister les entrées acceptées
- Supprimer les champs de commande arbitraire
- Revoir les permissions des job templates
- 01 AWX : concevoir des job templates qui ne deviennent pas une console distante dangereuse
- 02 Ansible en production : structurer un dépôt d’exploitation avant de l’exposer dans AWX
AI 2 notes
Un agent IA privé peut agir sans que l’action soit explicable
Relier sources, identités, appels d’outils, journaux et validation humaine avant d’augmenter l’autonomie.
Premiers contrôles - Lister les sources approuvées
- Tracer les appels d’outils
- Définir les points d’approbation humaine
- 01 Agent IA en réseau privé : quels contrôles garder autour des données, actions et journaux
- 02 AgentOps : diagnostiquer un agent IA qui appelle le mauvais outil
Cloud 1 note
Un consumer Azure Event Hubs accumule du retard
Séparer throttling du namespace, partition chaude, traitement consumer, progression des checkpoints et saturation aval avant d’ajouter de la capacité ou de rejouer des événements.
Premiers contrôles - Comparer ingress, egress et requêtes throttlées
- Mesurer progression et âge du checkpoint par partition
- Contrôler ownership, erreurs consumer et latence aval
- Prouver bornes de séquence et idempotence avant rejeu
- 01 Azure Event Hubs : diagnostiquer le retard consommateur avant de scaler ou rejouer
Automation 1 note
Un Hybrid Runbook Worker Azure Automation ne prend plus les jobs
Séparer distribution, heartbeat, état de l’extension, sortie HTTPS, capacité, runtime et identité avant de relancer un job de production.
Premiers contrôles - Conserver job ID, flux et fenêtre UTC
- Comparer HybridWorkerPing et état de l’extension dans le groupe
- Lire les logs locaux avant tout redémarrage
- Terminer un canary sans effet avant relance
- 01 Azure Automation : diagnostiquer un Hybrid Runbook Worker qui ne prend plus les jobs
Networking 1 note
Azure Bastion ne parvient pas à ouvrir une session SSH ou RDP
Séparer chemin HTTPS client, santé Bastion, règles AzureBastionSubnet, routage, NSG cibles, service invité et identité avant d’exposer les ports d’administration.
Premiers contrôles - Figer un échec avec heure UTC et IP privée cible
- Contrôler le provisioning Bastion et toutes les règles AzureBastionSubnet
- Inspecter les NSG effectifs et routes de la NIC cible
- Vérifier séparément service invité et authentification
- 01 Azure Bastion : diagnostiquer un échec SSH ou RDP avant d'ouvrir les NSG
Cloud 1 note
Une application épuise son pool de connexions Azure SQL
Séparer rétention locale des connexions, sessions et attentes SQL, échecs réseau, acquisition du jeton d’identité managée et multiplication liée à l’autoscaling avant de relever le pool ou le service tier.
Premiers contrôles - Relier un timeout à une révision et une instance
- Calculer l’enveloppe globale de capacité des pools
- Comparer sessions SQL, requêtes actives et attentes
- Tester la correction par canari avec arrêt et rollback
- 01 Azure SQL : diagnostiquer l'épuisement du pool de connexions avant de scaler
Cloud 1 note
Une image ACR échoue à la vérification de signature avant promotion AKS
Séparer tag mutable, signature absente, identité de publication non approuvée, rotation du trust store et accès ACR avant de contourner l’admission ou déployer une image non vérifiée.
Premiers contrôles - Résoudre le tag candidat vers un digest immuable
- Inventorier les signatures avec Notation
- Vérifier scope du repository, trust store et identité de publication
- Comparer le digest vérifié avec l’imageID runtime AKS
- 01 Azure ACR et AKS : vérifier la signature d’une image avant la promotion
Infrastructure 1 note
Un rollout de Deployment AKS reste bloqué avant que la nouvelle révision soit disponible
Localiser le premier objet bloqué entre Deployment, ReplicaSet, admission, scheduling, démarrage de l’image et readiness avant de supprimer des pods, allonger les timeouts ou forcer un rollback.
Premiers contrôles - Capturer les conditions du Deployment et l’historique du rollout
- Comparer pods désirés, créés et Ready sur le ReplicaSet candidat
- Lire les événements des pods et du namespace avant de changer la capacité
- Prouver la compatibilité de la configuration externe avant rollback
- 01 Azure AKS : diagnostiquer un rollout bloqué avant de forcer le rollback
Automation 1 note
Des runs Azure Logic Apps accumulent des 429 et des retries
Séparer limites de la ressource Logic Apps, throttling du connecteur et saturation de la cible avant d’ajouter des retries ou d’augmenter la concurrence.
Premiers contrôles - Geler un workflow, une action, une connexion et une fenêtre UTC
- Corréler les identifiants du run et de la requête cible
- Mesurer l’amplification par retries et concurrence
- Exécuter un canary borné avant une reprise par paliers
- 01 Azure Logic Apps : contenir le throttling des connecteurs avant d'ajouter des retries
Automation 1 note
Les évaluations d’un feature flag diffèrent entre les instances applicatives
Séparer définition publiée, ETag par instance, chemin de refresh, contexte de ciblage et télémétrie d’évaluation avant de redémarrer le parc ou rollbacker le flag.
Premiers contrôles - Figer le flag, le label, la fenêtre de changement et l’état précédent connu
- Comparer l’ETag publié entre instances saines et affectées
- Rejouer un contexte de ciblage stable sur un canari
- Corréler les événements FeatureEvaluation avec les traces de refresh et les métriques métier
- 01 Azure App Configuration : diagnostiquer la dérive d'un feature flag avant rollback
AI 1 note
Un agent IA perd ses contraintes quand la conversation s’allonge
Séparer consignes système, historique, retrieval, schémas et sorties d’outils avant d’augmenter la limite de contexte ou de changer de modèle.
Premiers contrôles - Figer une trace saine et une trace dégradée du même parcours
- Mesurer la croissance du contexte par segment et par tour
- Vérifier que les approbations et décisions ouvertes survivent à la compaction
- Tester la policy bornée sur un canari avant promotion
- 01 AgentOps : diagnostiquer une saturation de contexte avant d'augmenter la limite de tokens
Cloud 1 note
Les connexions Azure Managed Redis s’emballent pendant que l’application accumule des timeouts
Séparer pression serveur légitime, amplification des reconnexions clientes, DNS/TLS runtime et dérive de release avant de scaler ou déclencher une bascule.
Premiers contrôles - Figer release, nombre de replicas et fenêtre d’incident
- Comparer clients connectés, charge serveur et opérations utiles
- Mesurer l’enveloppe de connexions par instance
- Tester le correctif client en canari avec rollback explicite
- 01 Azure Managed Redis : contenir une tempête de connexions avant de scaler ou basculer
Infrastructure 1 note
Une alerte Azure Monitor se déclenche mais aucune action group ne notifie l’astreinte
Séparer évaluation du signal, traitement de l’alerte déclenchée, scope, filtres, horaire et livraison de l’action group avant de modifier la règle d’alerte.
Premiers contrôles - Figer un identifiant d’alerte déclenchée et ses action groups attendues
- Lister les règles de traitement actives et confronter leurs scopes
- Rejouer l’horaire dans son fuseau configuré
- Générer une nouvelle alerte bornée après propagation
- 01 Azure Monitor : diagnostiquer une suppression de notifications avant de modifier l'alerte
Cloud 1 note
Une read replica Azure Database for PostgreSQL prend du retard avant promotion
Séparer lag temporel, écart WAL en octets, rétention des logs sur le primaire, capacité de replay et état du chemin cible avant switchover planifié ou promotion forcée.
Premiers contrôles - Figer le mode de promotion et le RPO accepté
- Comparer lag en secondes, en octets et marqueur métier
- Contrôler stockage WAL primaire et saturation de la replica
- Valider virtual endpoints, identité et chemin d’écriture avant promotion
- 01 Azure PostgreSQL : diagnostiquer le lag d'une read replica avant promotion
Automation 1 note
Un runbook Azure Automation renvoie 403 après un changement d’identité managée
Séparer sandbox cloud et Hybrid Worker, identités du compte Automation et de la VM, contexte Az persistant, droits control plane et data plane avant d’élargir le RBAC.
Premiers contrôles - Figer job ID, cible d’exécution et opération refusée
- Réinitialiser le contexte Az et prouver le principal runtime
- Confronter action exacte, rôle et scope
- Exécuter des canaris positif et négatif avant promotion
- 01 Azure Automation : prouver l'identité du runbook avant d'élargir le RBAC
Networking 1 note
Un origin Azure Front Door devient unhealthy et le trafic bascule de façon inattendue
Séparer contrat du health probe, DNS/TLS, Private Link éventuel, capacité backend et changements de routage avant de drainer, basculer ou rétablir le trafic.
Premiers contrôles - Figer route, origin group et fenêtre UTC
- Lire les probes échoués par origin et par POP
- Vérifier hostname, SNI, certificat et réponse de santé
- Prouver la capacité de secours avant de modifier les poids
- 01 Azure Front Door : diagnostiquer un origin unhealthy avant de modifier le routage
AI 1 note
Un agent IA rappelle du contexte provenant d’une autre session ou équipe
Séparer historique de conversation, résumés compactés, mémoire durable, caches de retrieval, résultats d’outils et identité runtime avant d’activer la persistance pour davantage d’utilisateurs.
Premiers contrôles - Figer les frontières utilisateur, équipe, environnement et session
- Semer des canaris synthétiques distincts dans deux scopes
- Activer chaque couche d’état séparément
- Rejouer sous concurrence, expiration et révocation
- 01 AgentOps : valider l’isolation des sessions et de la mémoire avant la production
Infrastructure 1 note
Une fenêtre Azure Update Manager se termine avec une partie du parc encore non conforme
Séparer appartenance au scope dynamique, orchestration, budget de fenêtre épuisé, échecs de patch et reboots en attente avant de forcer une installation hors fenêtre.
Premiers contrôles - Figer le contrat de maintenance et l’inventaire attendu
- Comparer machines correspondantes, runs de maintenance et installations
- Séparer absence de run, exécution partielle, patch en échec et reboot en attente
- Prouver la capacité du service avant de reprendre un lot borné
- 01 Azure Update Manager : diagnostiquer une fenêtre de maintenance avant de forcer le patching
Cloud 1 note
Un certificat Azure App Service est renouvelé mais l’ancien certificat reste servi
Séparer émission, validation du domaine, version Key Vault, import App Service, binding du hostname et certificat observé avec SNI avant synchronisation ou rebinding.
Premiers contrôles - Lire l’empreinte servie avec le vrai hostname et SNI
- Comparer SAN et expiration du candidat avec l’inventaire App Service
- Contrôler version Key Vault et état d’import si applicable
- Conserver le binding actuel et le thumbprint de rollback
- 01 Azure App Service : diagnostiquer un renouvellement TLS avant de rebinder la production
Networking 3 notes
Un flux Azure est refusé alors que le NSG l’autorise
Séparer règles Security Admin Azure Virtual Network Manager, appartenance au network group, évaluation NSG et joignabilité réelle du service avant d’ouvrir les règles locales.
Premiers contrôles - Capturer le tuple exact source, destination et port
- Lister les règles Security Admin effectives sur le VNet
- Lancer IP Flow Verify et identifier la règle décisive
- Confirmer la décision dans les VNet flow logs
- 01 Azure Virtual Network Manager : diagnostiquer une règle Security Admin avant de modifier les NSG
- 02 Azure Network Watcher : valider les Flow Logs avant d'ouvrir une règle NSG
- 03 Azure Firewall : diagnostiquer une règle masquée avant d’ouvrir le trafic
Networking 2 notes
Un profil Azure Traffic Manager est dégradé et la bascule paraît incohérente selon les clients
Séparer contrat de probe déployé, état de monitoring des endpoints, preuves backend, réponses DNS, TTL et capacité secondaire avant de désactiver le primaire ou forcer la bascule.
Premiers contrôles - Capturer configuration du profil, des endpoints, de la probe et du TTL
- Rejouer exactement la probe depuis plusieurs points externes
- Corréler ProbeHealthStatusEvents et logs backend
- Comparer les réponses DNS et prouver la readiness secondaire
- 01 Azure Traffic Manager : diagnostiquer un profil dégradé avant de forcer le failover
- 02 Azure Service Health : qualifier un signal régional avant failover
Automation 1 note
Un runbook Azure Automation fonctionne dans son runtime actuel mais échoue dans l’environnement candidat
Séparer version du langage, résolution des packages, identité, sérialisation et préparation des Hybrid Workers avant de relier les runbooks de production.
Premiers contrôles - Figer les manifestes des runtimes actuel et candidat
- Lancer les tests positifs et négatifs du brouillon avec le candidat
- Qualifier chaque Hybrid Worker cible
- Tester un effet borné en canari puis confirmer un second run sans diff
- 01 Azure Automation : valider une migration de runtime avant de basculer les runbooks de production
Infrastructure 1 note
La cardinalité Azure Monitor Managed Prometheus explose après un déploiement AKS
Séparer pression d’ingestion du workspace, échecs de scrape, targets dupliquées et labels non bornés avant de filtrer les métriques, augmenter les quotas ou rollbacker la release.
Premiers contrôles - Figer workspace, cluster, release et fenêtre UTC
- Comparer les tendances de séries actives et d’ingestion
- Borner PromQL pour identifier métrique et label
- Tester le relabeling en canari sans casser les alertes
- 01 Azure Monitor Managed Prometheus : contenir une explosion de cardinalité avant d’augmenter les quotas
Infrastructure 1 note
Azure VMSS remplace ou réimage en boucle des instances unhealthy
Séparer signal de santé, grace period, état du service d’orchestration, modèle VMSS courant et contrat de persistance avant de modifier Replace, Reimage ou Restart.
Premiers contrôles - Figer la chronologie des réparations et la capacité utile
- Lire automaticRepairsPolicy et l’état du service d’orchestration
- Rejouer le contrat de santé sur instances saines et affectées
- Créer un canari depuis le modèle courant avant la reprise
- 01 Azure VMSS : diagnostiquer une boucle de réparations automatiques avant de changer l'action
Automation 1 note
Une image nouvellement poussée dans ACR n’est pas visible depuis toutes les régions de déploiement
Séparer géoréplication asynchrone, tags mutables, routage du endpoint global, identité runtime et joignabilité des endpoints de données avant de relancer un déploiement multirégion.
Premiers contrôles - Figer le digest du build et l’heure de fin du push
- Lister l’état des réplicas et consulter Resource Health
- Tirer le digest attendu depuis chaque région cible
- Corréler les événements ACR par région, identité et résultat
- 01 Azure Container Registry : diagnostiquer une réplication d'image incomplète avant de relancer un déploiement multirégion
Networking 1 note
Un flux service à service AKS est bloqué après un changement de NetworkPolicy
Séparer egress source, ingress destination, sélecteurs déployés, endpoints du Service et verdicts Cilium observés avant d’ajouter une règle allow-all ou de supprimer le default-deny.
Premiers contrôles - Figer source, destination, port et fenêtre UTC
- Lire le data plane AKS et chaque type de policy
- Comparer les sélecteurs aux labels de pods et namespaces déployés
- Exécuter des canaris positifs et négatifs avant promotion
- 01 AKS : diagnostiquer un flux bloqué par une NetworkPolicy avant de desserrer le trafic
Infrastructure 1 note
Le tail sampling OpenTelemetry réduit le volume mais les traces d’incident deviennent incomplètes ou disparaissent
Séparer affinité des traces, dimensionnement de la fenêtre, mémoire des traces en attente, spans tardifs, règles et preuves d’export avant d’élargir le déploiement.
Premiers contrôles - Figer les digests des configurations Collector actuelle et candidate
- Prouver que tous les spans d’une trace atteignent le même sampling shard
- Rejouer les canaris d’erreur, de latence et de span tardif
- Corréler les décisions du Collector avec les opérations complètes dans Azure Monitor
- 01 OpenTelemetry Collector : valider le tail sampling avant de perdre les traces d’incident
Infrastructure 1 note
Key Vault retourne 403 après une bascule vers Azure RBAC
Séparer identités runtime oubliées, correspondance des rôles data plane, scope et propagation des pannes réseau avant d’attribuer un rôle large ou de revenir au modèle précédent.
Premiers contrôles - Confirmer le modèle d’autorisation actif du coffre
- Résoudre l’object ID du principal runtime en échec
- Comparer les opérations requises aux rôles data plane directs et hérités
- Corréler les 403 avec les logs AuditEvent Key Vault
- 01 Azure Key Vault : migrer des access policies vers Azure RBAC sans couper les workloads
Networking 1 note
Des flux Virtual WAN sont coupés ou deviennent asymétriques après activation de Routing Intent
Séparer portée des policies, routes effectives, prefixes privés, propagation de la route par défaut, next hop de sécurité, SNAT et chemins retour avant d’élargir le déploiement ou de supprimer Routing Intent.
Premiers contrôles - Figer les anciennes associations et propagations de routes
- Vérifier chaque prefixe du contrat sur le next hop de sécurité
- Sonder les chemins aller et retour dans chaque hub concerné
- Corréler les canaris avec les allow et deny Firewall
- 01 Azure Virtual WAN : valider Routing Intent avant d'imposer l'inspection en production
Networking 1 note
Des pods AKS rencontrent des timeouts DNS ou des réponses SERVFAIL intermittentes
Séparer comportement du resolver du pod, amplification des requêtes, service DNS Kubernetes, endpoints CoreDNS, policy réseau, forwarding upstream et chemins propres aux nœuds avant de redémarrer CoreDNS.
Premiers contrôles - Figer les noms exacts, erreurs et cohortes de pods/nœuds touchées
- Comparer des résolutions répétées entre nœuds et namespaces
- Inspecter service kube-dns, EndpointSlices et pods CoreDNS
- Tester séparément noms du cluster et chaque suffixe upstream
- 01 AKS : diagnostiquer un DNS intermittent avant de redémarrer CoreDNS
Networking 1 note
Azure Firewall IDPS bloque un flux légitime après le passage d’une signature en blocage
Séparer preuve de signature, direction du trafic, classification des plages privées, inspection TLS et résultat applicatif avant de désactiver IDPS ou d’ajouter un bypass large.
Premiers contrôles - Figer la surcharge de signature et le five-tuple touché
- Interroger AZFWIdpsSignature par source, destination et action
- Rejouer un canari malveillant et un canari légitime
- Revenir uniquement à Alert pour la signature si le flux légitime régresse
- 01 Azure Firewall IDPS : valider une signature avant de la passer en blocage
Automation 1 note
Un job Azure Automation risque d’exécuter une version différente du commit approuvé
Relier commit source, job de synchronisation, hashes brouillon et publié, test sans effet et marqueur d’exécution avant toute relance ou extension du scope production.
Premiers contrôles - Figer commit approuvé, hash du script et compte cible
- Lire le dernier job de synchronisation et ses streams avant relance
- Exporter et hasher séparément brouillon et version publiée
- Exécuter Plan puis un canari réversible avant le scope complet
- 01 Azure Automation : prouver la version publiée avant d'exécuter un runbook
Infrastructure 1 note
Une alerte de logs Azure Monitor crée des centaines d’instances évaluées séparément
Séparer cohortes réellement touchées, cardinalité des dimensions, cycle de vie des alertes et routage des notifications avant de relever les limites, couper l’action group ou modifier la règle KQL.
Premiers contrôles - Exporter la scheduled query rule et figer une fenêtre UTC
- Compter lignes, valeurs distinctes et combinaisons de dimensions
- Comparer combinaisons KQL, instances actives et notifications livrées
- Canaryer les dimensions stables sur un cycle complet de déclenchement et résolution
- 01 Azure Monitor : contenir le fan-out d'une alerte de logs avant de modifier la règle KQL
AI 1 note
Un AI gateway retourne 429 après un changement de policy de limite de tokens
Séparer scope de policy APIM, isolation des compteurs, comptage par gateway, estimation des tokens, throttling backend et retries clients avant d’augmenter le budget.
Premiers contrôles - Figer une requête refusée avec gateway, région et Retry-After
- Prouver si APIM ou le backend modèle a produit le 429
- Vérifier la policy effective et une clé de compteur non vide
- Canaryer la correction sans réinitialiser les compteurs de production
- 01 Azure API Management AI gateway : diagnostiquer un 429 token limit avant d'augmenter le quota
Networking 1 note
Un chemin applicatif Azure échoue par intermittence alors que les tests manuels restent sains
Utiliser Connection Monitor pour conserver perte et latence par source, puis corréler un intervalle en échec avec DNS, routes effectives, décisions de sécurité, preuves firewall et santé du service avant de modifier NSG ou UDR.
Premiers contrôles - Figer source, FQDN, port et fenêtre UTC exacts
- Comparer taux d’échec et RTT par source
- Lancer Connection Troubleshoot pendant l’intervalle défaillant
- Canaryer une correction bornée avec un contrôle de refus
- 01 Azure Network Watcher : diagnostiquer un chemin intermittent avant de modifier NSG ou UDR
AI 1 note
Un agent IA propose une action de production non demandée après avoir lu la sortie d’un outil MCP
Séparer transport authentifié et confiance au niveau des champs, conserver la provenance du résultat, appliquer l’autorisation d’écriture hors du modèle et rejouer des résultats adversariaux avant de rouvrir les actions de production.
Premiers contrôles - Figer intention utilisateur, résultat brut et prochain appel proposé
- Identifier le champ non fiable qui a influencé l’action
- Vérifier approbation et arguments dans une porte de policy externe
- Rejouer les résultats hostiles avec écritures coupées avant un canari borné
- 01 AgentOps : neutraliser une injection indirecte dans la sortie d'un outil MCP avant une action de production
AI 1 note
Un agent reste disponible grâce au fallback de modèle mais change ses décisions d’outils ou ses refus
Séparer disponibilité de l’endpoint et compatibilité des schémas de réponse, outils, sources, refus, approbations, état et traces avant d’activer le routage multi-modèle automatique.
Premiers contrôles - Figer les deux tentatives sous un même identifiant de run logique
- Valider sortie structurée et arguments d’outils normalisés
- Réconcilier tout résultat principal inconnu avant fallback
- Canaryer de nouvelles sessions en lecture seule avec des traces par route
- 01 AgentOps : valider un modèle de repli avant d'activer le routage multi-modèle
Infrastructure 1 note
Un Horizontal Pod Autoscaler AKS monte et descend en boucle
Séparer métriques bruitées ou manquantes, requests mal calibrées, warm-up des pods, contrôleurs concurrents et capacité nœud avant de relever les bornes de replicas.
Premiers contrôles - Figer deux cycles complets de scaling
- Comparer le statut HPA avec l’API de métriques
- Mesurer requests, readiness et capacité aval par replica
- Canaryer un seul changement de comportement avec rollback explicite
- 01 Azure AKS : diagnostiquer un HPA qui oscille avant d'augmenter les replicas
Cloud 1 note
Un déploiement Azure échoue parce qu’une ressource ou un scope hérité est verrouillé
Séparer management locks, RBAC, Policy et deny assignments, identifier l’opération destructive exacte, puis borner toute fenêtre de déverrouillage avant relance ou rollback.
Premiers contrôles - Figer l’opération en échec, la ressource cible et le correlation ID
- Reconstruire les locks CanNotDelete et ReadOnly hérités
- Confirmer que le plan exige réellement un delete
- Recréer et vérifier le verrou avant de clore le changement
- 01 Azure Resource Locks : diagnostiquer un déploiement bloqué avant de retirer le verrou
Networking 2 notes
Des pods AKS subissent des timeouts intermittents vers des dépendances publiques
Séparer DNS, dépendance distante, politique réseau, pression de connexions du nœud et équipement de sortie Azure effectif avant d’ajouter de la capacité SNAT ou de modifier la sortie du cluster.
Premiers contrôles - Capturer le pod, le nœud et le tuple de destination en échec
- Confirmer networkProfile.outboundType et l’IP source vue en aval
- Corréler les métriques SNAT par nœud avec le churn de connexions
- Canaryer la réutilisation des connexions ou la capacité egress avant généralisation
- 01 Azure AKS : diagnostiquer l’épuisement SNAT avant d’ajouter un NAT Gateway
- 02 Azure NAT Gateway : diagnostiquer l’épuisement SNAT et la dérive d’IP sortante
Automation 1 note
Une règle Microsoft Sentinel manque une cible ou automatise une réponse depuis une watchlist périmée
Séparer fraîcheur de la source, complétude du snapshot, sémantique de suppression des mises à jour en masse, normalisation du SearchKey et comportement de jointure KQL avant de laisser une watchlist piloter incidents ou playbooks.
Premiers contrôles - Prouver alias et snapshot source indépendamment de TimeGenerated
- Comparer clés ajoutées, modifiées et supprimées avec la version active
- Refuser les SearchKey vides, dupliqués ou expirés
- Évaluer la règle en shadow avant d’activer le playbook
- 01 Microsoft Sentinel : valider une watchlist avant qu'elle ne pilote une réponse automatisée
Infrastructure 1 note
Un agent Azure DevOps auto-hébergé montre des signes de compromission mais peut encore recevoir des jobs de production
Arrêter l’ordonnancement sans effacer les preuves, reconstruire les runs touchés, cartographier les identités exposées et valider un remplacement sain avant de rouvrir le pool.
Premiers contrôles - Isoler l’agent et suspendre les points d’entrée de production
- Figer run IDs, commits, diagnostics agent et événements d’audit
- Cartographier identifiants et cibles aval utilisés dans la fenêtre
- Canaryer un remplacement sain sans ressource protégée
- 01 Azure DevOps : contenir un agent auto-hébergé compromis avant de rouvrir le pool
Networking 1 note
Un plan App Service reste en ligne mais son scaling échoue sur un subnet VNet Integration
Séparer épuisement d’adresses, libération différée, délégation et panne du chemin sortant ; calculer le chevauchement des workers avant de relancer le scaling ou migrer l’intégration.
Premiers contrôles - Figer l’opération en échec et le nombre d’instances
- Inventorier chaque application et plan joints au subnet
- Calculer les adresses utilisables et le chevauchement transitoire
- Canaryer un subnet délégué plus grand avec rollback explicite
- 01 Azure App Service VNet Integration : diagnostiquer l’épuisement du subnet avant de relancer le scaling
Cloud 1 note
Azure WAF semble appliquer un comportement de policy différent après un déploiement
Séparer état du déploiement ARM, associations gateway, listener et path rule, priorité réellement déployée et variations des requêtes avant d’attendre ou de restaurer toute la policy.
Premiers contrôles - Figer une requête acceptée et une requête bloquée
- Lire les provisioning states de la policy et de la gateway
- Inventorier les resource IDs de policy sur chaque scope d’association
- Rejouer un canari autorisé et un canari refusé après correction ou rollback
- 01 Azure WAF : diagnostiquer une policy appliquée de façon incohérente après déploiement
Automation 1 note
Un déploiement Azure auparavant autorisé est refusé après l’expiration de son exemption Policy
Relier le premier refus à expiresOn, à l’assignment exacte, aux références d’initiative et à l’état courant de la ressource avant de renouveler l’exemption ou désactiver la garde.
Premiers contrôles - Figer le premier run refusé et son correlation ID
- Lire l’exemption à son scope exact et comparer expiresOn en UTC
- Faire correspondre les IDs d’assignment et de référence d’initiative
- Canaryer le même artefact avec un contrôle de refus hors scope
- 01 Azure Policy : diagnostiquer une exemption expirée avant de désactiver l'assignment
AI 1 note
Une trace d’agent IA contient des données sensibles après un changement d’instrumentation
Relier release, span, champ fautif, route d’export et destination avant de couper l’observabilité ; contenir le chemin précis, traiter les copies historiques et canaryer la redaction.
Premiers contrôles - Figer les métadonnées de trace sans recopier la valeur brute
- Cartographier chaque copie dans collectors, exporters et destinations
- Désactiver l’enrichissement fautif en gardant les événements minimaux
- Rejouer des marqueurs synthétiques par chaque chemin d’entrée
- 01 AgentOps : contenir des données sensibles dans les traces avant de couper l'observabilité
Automation 1 note
Un déploiement Azure DevOps annulé laisse la cible de production dans un état partiel incertain
Réconcilier run, agent, control plane Azure et application avant toute relance ; prouver chaque checkpoint, artefact et effet, puis choisir reprise, compensation ou rollback.
Premiers contrôles - Geler chaque writer ciblant l’environnement
- Figer run, commit et digest de l’artefact
- Lire les opérations côté cible sur la fenêtre d’annulation
- Bloquer la relance tant qu’un checkpoint critique reste inconnu
- 01 Azure DevOps : diagnostiquer un déploiement annulé avant de relancer la production
AI 1 note
Un indexer Azure AI Search réussit partiellement et le corpus de l’agent devient incomplet
Séparer accès source, tracking incrémental, échecs du skillset et écritures dans l’index cible avant de rejouer des documents ou d’effacer le high-water mark.
Premiers contrôles - Figer l’historique d’exécution et les états de tracking
- Réconcilier identifiants source, clés d’index et versions
- Regrouper les erreurs par étage, code et skill
- Canaryer la reprise ciblée avant tout reset complet
- 01 Azure AI Search : diagnostiquer un échec partiel d'indexer avant le reset