Cisco 350-401: Assurance réseau, opérations et dépannage — Guide d'étude
Fait partie du Cisco CCNP Enterprise 350-401 ENCOR — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Cisco, ou passez des tests chronométrés sur ExamRoll.io.
Vue d’ensemble
L’assurance, les opérations et le dépannage réseau combinent une observabilité proactive avec une réponse aux incidents disciplinée pour maintenir la fiabilité, la sécurité et la performance des réseaux d’entreprise. Une pratique efficace couvre la gestion FCAPS, la conception de la télémétrie, les informations pilotées par le contrôleur, l’isolation structurée des problèmes de la couche 1 à la couche 7, la validation de la haute disponibilité et un cycle de vie rigoureux pour les logiciels et les changements. L’objectif n’est pas seulement de détecter et de corriger les pannes, mais de mesurer les résultats des services par rapport à des objectifs explicites, de favoriser l’élimination des causes profondes et d’optimiser en continu la capacité et l’expérience utilisateur.
Stratégie FCAPS et de surveillance
FCAPS définit un modèle opérationnel complet :
- Gestion des pannes (Fault) : Détection rapide, corrélation, triage et remédiation des événements avant que les utilisateurs ne les remarquent. Prioriser les signaux de santé qui indiquent un impact sur les services métier, pas seulement l’état haut/bas (up/down) des équipements.
- Gestion de la configuration (Configuration) : Contrôle de version, modèles de référence, vérifications de conformité, validation de l’intention et détection automatisée de la dérive. Les sauvegardes et les points de restauration sont des garde-fous obligatoires pour la vélocité des changements.
- Gestion de la comptabilité (Accounting) : Visibilité sur qui a utilisé quelles ressources et quand. Utiliser les enregistrements de flux et les journaux du contrôleur pour la refacturation/facturation interne et la détection d’anomalies (par ex., des pics de trafic est-ouest inattendus).
- Gestion de la performance (Performance) : Mesure continue de la latence, de la perte, de la gigue, du débit et du temps d’intégration des clients par rapport aux lignes de base et aux objectifs de niveau de service (SLO). Prévoir les risques de saturation.
- Gestion de la sécurité (Security) : Centraliser l’identité, l’autorisation, la posture de chiffrement et la télémétrie pour la détection des menaces. Intégrer avec le NAC, la segmentation et les analyses du contrôleur.
Systèmes de surveillance et tableaux de bord
- Architecturer une pile en couches : santé des équipements (matériel, interfaces), santé du plan de contrôle (routage, CAPWAP, overlays), santé du plan de données (files d’attente, rejets, flux) et métriques de l’expérience utilisateur.
- Vues orientées par rôle : tableaux de bord du NOC pour la santé en temps réel et l’état des SLO, vues d’ingénierie pour les diagnostics approfondis, et vues pour la direction pour les tendances et les risques.
- Lignes de base et SLO : Établir des lignes de base par site et par segment ; utiliser des seuils dynamiques qui s’adaptent aux cycles diurnes. Définir des SLO tels que « latence WAN au 95e centile < 60 ms » ou « intégration des clients Wi-Fi < 7 secondes ».
- Conception des alertes : Préférer les alertes symptôme+contexte (par ex., « Perte > 2 % et gigue > 30 ms pendant 5 min sur le VPN WAN 10 ») aux tempêtes de traps brutes. Utiliser le taux de changement, les fenêtres de persistance et la corrélation multi-signaux. Supprimer les alertes pendant les fenêtres de maintenance approuvées.
Compromis et modes de défaillance
- La sur-alerte provoque de la fatigue ; la sous-alerte masque les pannes latentes. Calibrer les seuils en utilisant des lignes de base réelles.
- Les collecteurs centralisés peuvent devenir des goulots d’étranglement ; mettre à l’échelle horizontalement et sécuriser avec TLS et un accès basé sur les rôles.
- Dans les domaines virtualisés, de larges empreintes L2 et des charges de travail dépendantes du broadcast peuvent amplifier les tempêtes ; segmenter et élaguer les domaines de broadcast et préférer un accès routé.
Télémétrie, journaux et visibilité du trafic
Plans de données clés pour l’assurance
- Syslog : Flux d’événements lisible par l’homme avec des niveaux de sévérité. Transférer vers des collecteurs centralisés ; normaliser et corréler. Critique pour la sécurité, les adjacences de routage, l’état de la haute disponibilité (HA) et les problèmes de jonction WLC/AP.
- SNMP : Interroger les compteurs (par ex., erreurs d’interface, rejets de file d’attente) et recevoir des traps/informs. Utiliser SNMPv3 pour l’authentification/confidentialité. Les intervalles d’interrogation doivent correspondre au besoin d’une vue quasi temps réel par rapport à la charge du collecteur.
- NetFlow/IPFIX : Métadonnées par flux pour le qui/quoi/où. Permet la planification de la capacité, la vérification des SLO et la détection d’anomalies. Exporter depuis la distribution/périphérie et les CPE WAN.
- Télémétrie en streaming : Pilotée par modèle, basée sur le push (par ex., gNMI sur IOS-XE). Se met à l’échelle mieux que SNMP pour les métriques à haute cardinalité ; faible latence pour les métriques de file d’attente, de CPU et RF.
- Capture de paquets : SPAN/RSPAN/ERSPAN ou sondes en ligne lorsque le signal est ambigu. Limiter les captures dans le temps ; filtrer par des ACL pour réduire le bruit.
Exemples courts
- NetFlow (IOS-XE) :
undefined
undefined
undefined
undefined
- Télémétrie pilotée par modèle (IOS-XE) :
undefined
undefined
undefined
undefined
Signaux sans fil et pilotés par le contrôleur
- Le RRM s’exécute sur le contrôleur sans fil ; ingérer les événements RRM et les métriques RF (utilisation des canaux, niveau de bruit, tentatives de reconnexion des clients) pour le réglage de la couverture/capacité.
- Découverte CAPWAP : Utiliser l’option DHCP 43 ou ip helper. Pour un Cisco WLC, encoder correctement l’option 43 (par ex., hex F104.AC10.3205 pour 172.16.50.5). Mobility Express peut fournir des fonctions de contrôleur local dans les petites agences.
Visibilité de l’overlay et de la segmentation
- SD-Access : Le réseau overlay fournit une segmentation logique L2/L3. Les VNID/VNI maintiennent l’isolation ; le nœud de bordure de la fabric (fabric border node) connecte la fabric aux réseaux externes.
- VXLAN : Encapsule les trames L2 dans IP/UDP pour le transport L3 ; les VNI segmentent le trafic L2/L3. Surveiller l’accessibilité des VTEP et la santé de l’underlay.
- Multicast : Dans PIM-SM, le RP n’est généralement nécessaire que pour démarrer de nouvelles sessions ; assurer l’accessibilité du RP et MSDP/Anycast-RP selon le cas.
Vérification de la QoS et des SLA
- La classification utilise généralement le champ IP TOS/DSCP ; vérifier les comportements de re-marquage et de mise en file d’attente à l’aide de la télémétrie des interfaces de sortie. Suivre la perte/gigue par classe pour prouver la conformité aux SLO.
Dépannage structuré et isolation des couches 1 à 7
Méthodologie
- Définir le problème et le domaine d’impact ; quantifier les symptômes par rapport à une référence.
- Formuler des hypothèses qui expliquent les symptômes avec un minimum de suppositions.
- Sélectionner des tests qui invalident rapidement les hypothèses avec le moins d’intrusivité possible.
- Changer une seule variable à la fois ; confirmer la correction et surveiller toute régression.
- Documenter la cause racine et les actions préventives.
Indices couche par couche
- Couche 1 : Puissance optique, câblage, budgets PoE, liaisons unidirectionnelles. Dans StackWise Virtual, LMP rejette la transmission unidirectionnelle — investiguer les optiques non correspondantes ou la polarité de la fibre.
- Couche 2 : Présence de VLAN/VXLAN, état STP, MTU, battements d’adresses MAC (MAC flaps). Les non-concordances de VNI/VNID VXLAN se manifestent par des segments isolés avec une joignabilité normale de l’underlay.
- Couche 3 : Sous-réseaux (subnetting), politiques de fuite de routes/VRF, comportement des passerelles HSRP/GLBP/VSS, asymétrie ECMP. Une non-concordance entre l’IP virtuelle HSRP et la configuration du pair empêche le bon fonctionnement de la passerelle ; alignez l’IP virtuelle. GLBP ou une paire VSS permet à tous les hôtes d’un VLAN d’utiliser simultanément des passerelles actives.
- Couches 4 à 7 : ACL/NAT, TCP MSS/PMTUD, DNS/DHCP, handshake applicatif, pertes QoS. Valider la préservation du DSCP de bout en bout. Pour le multicast, confirmer l’état RP/Join.
- Spécificités du plan de contrôle :
- Les adjacences OSPF échouent en raison de zones, de minuteurs, de types de réseau non concordants, ou d’une non-concordance d’IP sur les liaisons point à point.
- Les sessions BGP configurées avec MD5 doivent avoir des mots de passe et des peer-groups correspondants des deux côtés ; un « invalid MD5 digest » indique une non-concordance ou une altération en transit.
- Les VPN SD-WAN définissent la segmentation ; les politiques de données (data policies) orientent les flux en fonction des champs et des ID de VPN. vManage fournit le plan de gestion unique — vérifier l’intention par rapport à l’état réalisé.
- Intégration sans fil (onboarding) : Valider la sécurité du SSID (par ex., WPA2/AES avec 802.1X pour l’accès des employés), DHCP/DNS, le canal/la puissance RRM, et le contrôle CAPWAP. Les erreurs de formatage de l’Option 43 sont des bloqueurs d’association courants.
Sélection des tests et compromis
- Préférer d’abord la télémétrie et les pings/traces ciblés ; passer à la capture de paquets lorsque plusieurs hypothèses subsistent.
- Utiliser les historiques de type « 360 » des équipements et des clients pour corréler les changements alignés dans le temps (par ex., une mise à niveau logicielle ou un changement de canal RRM) avec l’apparition des symptômes.
Haute disponibilité, cycle de vie et amélioration continue
Validation de la haute disponibilité
- Cœur de campus : Utiliser des liaisons point à point redondantes de couche 3 entre les équipements de cœur pour une convergence déterministe et rapide. Valider les temporisateurs IGP, BFD et les chemins à coût égal.
- Supervisor SSO : Nécessite la synchronisation d’état ; associer avec NSF pour maintenir le transfert L3 ininterrompu pendant le basculement. Tester le basculement en charge et assurer la continuité FHRP/adjacence.
- Redondance de premier saut : Valider les temporisateurs HSRP/GLBP, la préemption et la cohérence des adresses IP virtuelles entre les pairs.
- Bordures SD-Access : Tester la joignabilité externe et l’annonce/traduction de la fabrique au niveau des nœuds de bordure ; vérifier la segmentation basée sur les politiques à travers les frontières.
Maintenance et gestion des changements
- Avant le changement : Définir un MOP avec les objectifs, le plan de retour arrière, les critères de réussite et le plan de surveillance. Faire une revue par les pairs et planifier dans une fenêtre de maintenance.
- Exécution : Geler les changements non liés. Mettre en œuvre par petits rayons d’impact avec des points de contrôle. Supprimer temporairement les alertes non exploitables.
- Après le changement : Exécuter des vérifications post-changement par rapport aux bases de référence et aux SLO pendant au moins un cycle d’activité ; réactiver les alertes et confirmer la qualité du signal.
Cycle de vie des images logicielles
- Maintenir des images de référence (golden images) par plateforme, avec validation cryptographique. Déployer dans un laboratoire ou un anneau pilote ; capturer les bases de référence fonctionnelles et de performance.
- Mises à niveau : Préférer les méthodes compatibles ISSU/SSO là où elles sont prises en charge ; sinon, planifier des mises à niveau progressives (rolling upgrades) qui maintiennent le flux de trafic via des pairs redondants.
- Retour arrière : Conserver les dernières images fonctionnelles connues et les instantanés de configuration ; vérifier les variables de démarrage et les chemins de récupération ROMMON.
- Sauvegardes : Automatiser les sauvegardes de configuration à chaque commit ; stocker avec un versionnage et des différentiels de changement. Utiliser des vérifications de conformité pour signaler les dérives.
Analyse des causes profondes et amélioration post-incident
- RCA : Construire une chronologie à partir de la télémétrie corrélée, des commits et des journaux du contrôleur ; identifier la faille initiatrice unique et les facteurs contributifs.
- Documentation : Saisir l’impact, le MTTR, les indicateurs, les artefacts de test et les actions correctives permanentes. Partager largement.
- Amélioration : Convertir les correctifs en politique ou en automatisation (par ex., règles de conformité, modèles). Ajouter de nouveaux détecteurs si le signal était auparavant invisible.
Métriques opérationnelles et prévision de capacité
- Santé : Disponibilité, temps moyen de détection/réparation, taux d’échec des changements, fidélité des alertes.
- Performance : Perte/gigue par classe, percentiles de profondeur de file d’attente, taux de réessai RF, temps d’intégration des clients.
- Capacité : Percentiles d’utilisation des interfaces, concurrence des flux, consommation TCAM, marge CPU/mémoire, utilisation du temps d’antenne (airtime) des points d’accès.
- Prévision : Utiliser les tendances de NetFlow/IPFIX et de la télémétrie pour prédire quand les limites de capacité des liaisons, des cellules RF ou du plan de contrôle seront dépassées. Planifier les mises à niveau ou les changements de politique avant que les SLO ne se dégradent.
Assurance pilotée par le contrôleur
- Cisco DNA Center agrège les informations sur les équipements et les clients (path trace, vues 360) et corrèle les données RF, de commutation, de routage et d’identité. Il valide l’intention par rapport à l’état, signale les mauvaises configurations et prend en charge la remédiation proactive.
- Dans le SD-WAN, vManage fournit une gestion centralisée (single-pane), un suivi des SLO pour le routage applicatif et des audits de conformité des politiques.
Scénario de problème pratique
Contoso Retail exploite un campus à trois niveaux avec SD-Access pour la segmentation et un contrôleur sans fil centralisé. Les utilisateurs signalent des problèmes intermittents de qualité vocale et des échecs occasionnels d’intégration Wi‑Fi dans deux bâtiments.
Approche
Définir le périmètre et les SLO
- Identifier les services impactés : VoIP dans le VPN 10 (segment voix) et SLO de temps d’intégration Wi-Fi (<7 secondes).
- Justification : Des SLO clairs permettent une sélection de signaux ciblée et un test d’acceptation de type succès/échec pour le correctif.
Corréler la télémétrie et les événements
- Examiner DNA Center Assurance : santé du chemin vocal, chronologies client 360 et vue équipement 360 pour les commutateurs de distribution.
- Extraire la télémétrie en continu (streaming telemetry) pour les rejets par classe et les métriques RF ; interroger NetFlow/IPFIX pour le cheminement DSCP EF des flux vocaux.
- Justification : La corrélation multi-sources et alignée dans le temps réduit les approximations et fait apparaître la première déviation.
Valider l’underlay de couches 1 à 3 et la haute disponibilité
- Exécuter un path trace entre les terminaux vocaux ; vérifier les liaisons cœur P2P L3 redondantes et les temporisateurs IGP/BFD pour un basculement rapide.
- Vérifier l’état de StackWise Virtual et les journaux LMP pour les rejets de liaison unidirectionnelle sur la paire de distribution.
- Justification : Des défauts unidirectionnels subtils ou une convergence lente peuvent se manifester par des dégradations vocales transitoires.
Vérifier la politique de premier saut et de QoS
- Inspecter HSRP/GLBP pour le VLAN voix ; confirmer la cohérence de l’IP virtuelle et la préemption. Valider le re-marquage DSCP EF et la conformité de la politique de file d’attente sur les interfaces de sortie.
- Justification : Un désalignement de la passerelle ou une QoS mal appliquée provoque de la gigue, des pertes et un routage asymétrique pour le trafic en temps réel.
Analyser l’intégration sans fil
- Examiner les journaux du WLC pour les changements RRM et la stabilité de la jonction des points d’accès. Confirmer l’encodage de l’option DHCP 43 pour les VLAN des points d’accès distants et s’assurer que
undefined
est configuré.
- Valider la posture de sécurité du SSID (WPA2/AES avec 802.1X) et la latence d’authentification dans les journaux du contrôleur et d’identité.
- Justification : Un formatage incorrect de l’option 43 et des changements excessifs de canal/puissance par RRM prolongent l’intégration et augmentent les tentatives.
Inspecter l’overlay et les bordures SD-Access
- Vérifier les mappages VNID pour le VPN 10 et les annonces des nœuds de bordure de la fabrique vers les services externes (contrôleurs d’appel).
- Justification : Des incohérences VNI/VNID ou des problèmes de traduction à la bordure isolent les terminaux vocaux malgré un underlay sain.
Exécuter des tests ciblés
- Placer des sondes vocales synthétiques mesurant la perte/gigue ; capturer un court ERSPAN depuis une interface de sortie montrant des rejets dans la file d’attente EF pendant les pics.
- Justification : Une preuve objective lie les symptômes à des interfaces et des files d’attente spécifiques.
Remédier et valider
- Remplacer une paire de fibres suspecte signalée par LMP ; aligner l’IP virtuelle HSRP sur la norme documentée ; resserrer les intervalles de changement RRM ; corriger l’option DHCP 43 en hexadécimal sur les étendues affectées.
- Réappliquer les modèles de QoS en garantissant une bande passante minimale pour EF et en désactivant WRED pour EF.
- Justification : Traite les défauts profonds et applique les meilleures pratiques pour le trafic en temps réel.
Surveillance post-changement et RCA
- Suivre les SLO vocaux et le temps d’intégration pendant une journée ouvrable complète. Documenter la cause profonde (liaison unidirectionnelle provoquant une micro-convergence, dérive du VIP HSRP, option 43 malformée) et les contrôles préventifs (certification de la fibre, vérifications de conformité de la configuration, analyse statique des étendues DHCP).
- Justification : Confirme une reprise durable et institutionnalise les apprentissages sous forme de politique et d’automatisation.
← Automatisation · Tous les domaines
Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Réussissez votre examen →