Cisco 350-401: Aseguramiento, Operaciones y Solución de Problemas de Red — Guía de estudio
Forma parte de la Cisco CCNP Enterprise 350-401 ENCOR — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Cisco, o realiza tests cronometrados en ExamRoll.io.
Descripción general
La garantía, las operaciones y la solución de problemas de red combinan la observabilidad proactiva con una respuesta a incidentes disciplinada para mantener las redes empresariales fiables, seguras y con un alto rendimiento. Una práctica eficaz abarca la gestión FCAPS, el diseño de telemetría, los conocimientos basados en controladoras, el aislamiento estructurado de problemas desde la Capa 1 hasta la Capa 7, la validación de alta disponibilidad y un ciclo de vida riguroso para el software y los cambios. El objetivo no es solo detectar y corregir fallos, sino también medir los resultados del servicio en función de objetivos explícitos, impulsar la eliminación de la causa raíz y optimizar continuamente la capacidad y la experiencia del usuario.
Estrategia de FCAPS y monitorización
FCAPS define un modelo operativo completo:
- Gestión de fallos (Fault): Detección rápida, correlación, triaje y remediación de eventos antes de que los usuarios los noten. Priorice las señales de estado que indican un impacto en los servicios de negocio, no solo el estado de actividad/inactividad (up/down) de un dispositivo.
- Gestión de la configuración (Configuration): Control de versiones, plantillas de referencia (golden templates), comprobaciones de cumplimiento, validación de la intención y detección automatizada de desviaciones (drift). Las copias de seguridad y los puntos de restauración son barreras de protección obligatorias para la velocidad de los cambios.
- Gestión de contabilidad (Accounting): Visibilidad sobre quién usó qué recursos y cuándo. Utilice registros de flujo y logs de la controladora para impulsar la imputación de costes (chargeback/showback) y detectar anomalías (p. ej., picos inesperados de tráfico este-oeste).
- Gestión del rendimiento (Performance): Medición continua de la latencia, la pérdida de paquetes, el jitter, el rendimiento (throughput) y el tiempo de incorporación de clientes en comparación con las líneas base y los objetivos de nivel de servicio (SLO). Pronostique los riesgos de saturación.
- Gestión de la seguridad (Security): Centralice la identidad, la autorización, la postura de cifrado y la telemetría para la detección de amenazas. Integre con NAC, segmentación y analíticas de la controladora.
Sistemas de monitorización y paneles de control
- Diseñe una pila por capas: estado del dispositivo (hardware, interfaces), estado del plano de control (enrutamiento, CAPWAP, overlays), estado del plano de datos (colas, descartes, flujos) y métricas de experiencia del usuario.
- Vistas orientadas a roles: Paneles del NOC para el estado en tiempo real y el estado de los SLO, vistas de ingeniería para diagnósticos profundos y vistas ejecutivas para tendencias y riesgos.
- Líneas base y SLO: Establezca líneas base por sitio y por segmento; utilice umbrales dinámicos que se adapten a los ciclos diurnos. Defina SLO como “latencia WAN del percentil 95 < 60 ms” o “incorporación de clientes Wi-Fi < 7 segundos”.
- Diseño de alertas: Prefiera alertas de síntoma+contexto (p. ej., “Pérdida en WAN VPN 10 > 2% y jitter > 30 ms durante 5 min”) en lugar de tormentas de traps sin procesar. Utilice la tasa de cambio, las ventanas de persistencia y la correlación de múltiples señales. Suprima las alertas durante las ventanas de mantenimiento aprobadas.
Compensaciones y modos de fallo
- El exceso de alertas causa fatiga; la falta de alertas oculta fallos latentes. Calibre los umbrales utilizando líneas base reales.
- Los recolectores centralizados pueden convertirse en cuellos de botella; escale horizontalmente y protéjalos con TLS y acceso basado en roles.
- En dominios virtualizados, las grandes huellas L2 y las cargas de trabajo que dependen de broadcast pueden amplificar las tormentas; segmente y pode los dominios de broadcast y prefiera el acceso enrutado.
Telemetría, logs y visibilidad del tráfico
Planos de datos clave para la garantía
- Syslog: Flujo de eventos legible por humanos con niveles de severidad. Reenvíe a recolectores centralizados; normalice y correlacione. Crítico para la seguridad, las adyacencias de enrutamiento, el estado de HA y los problemas de unión de WLC/AP.
- SNMP: Consulte contadores (p. ej., errores de interfaz, descartes de cola) y reciba traps/informs. Use SNMPv3 para autenticación/privacidad. Los intervalos de sondeo (polling) deben alinearse con la necesidad de una vista casi en tiempo real frente a la carga del recolector.
- NetFlow/IPFIX: Metadatos por flujo sobre quién/qué/dónde. Permite la planificación de capacidad, la verificación de SLO y la detección de anomalías. Exporte desde la distribución/borde y los CPE de la WAN.
- Telemetría por streaming: Basada en modelos y de tipo push (p. ej., gNMI en IOS-XE). Escala mejor que SNMP para métricas de alta cardinalidad; baja latencia para métricas de cola, CPU y RF.
- Captura de paquetes: SPAN/RSPAN/ERSPAN o taps en línea cuando la señal es ambigua. Limite el tiempo de las capturas; filtre por ACL para reducir el ruido.
Ejemplos cortos
- NetFlow (IOS-XE):
undefined
undefined
undefined
undefined
- Telemetría basada en modelos (Model-Driven Telemetry) (IOS-XE):
undefined
undefined
undefined
undefined
Señales inalámbricas y basadas en controladora
- RRM se ejecuta en la controladora inalámbrica; ingiera eventos de RRM y métricas de RF (utilización del canal, nivel de ruido, reintentos del cliente) para ajustar la cobertura/capacidad.
- Descubrimiento de CAPWAP: Use la opción 43 de DHCP o
ip helper. Para Cisco WLC, codifique la opción 43 correctamente (p. ej., hex F104.AC10.3205 para 172.16.50.5). Mobility Express puede proporcionar funciones de controladora local en sucursales pequeñas.
Visibilidad de la superposición (overlay) y la segmentación
- SD-Access: La red de superposición (overlay) proporciona segmentación lógica L2/L3. Los VNID/VNI mantienen el aislamiento; el nodo de borde del fabric conecta el fabric con redes externas.
- VXLAN: Encapsula tramas L2 en IP/UDP para el transporte L3; los VNI segmentan el tráfico L2/L3. Supervise la alcanzabilidad de los VTEP y el estado de la red subyacente (underlay).
- Multicast: En PIM-SM, el RP generalmente solo se necesita para iniciar nuevas sesiones; asegure la alcanzabilidad del RP y MSDP/Anycast-RP según corresponda.
Verificación de QoS y SLA
- La clasificación suele utilizar el campo IP TOS/DSCP; verifique los comportamientos de remarcado y de las colas utilizando la telemetría de las interfaces de egreso. Realice un seguimiento de la pérdida/jitter por clase para demostrar el cumplimiento de los SLO.
Resolución de problemas estructurada y aislamiento de capas 1 a 7
Metodología
- Definir el problema y el dominio de impacto; cuantificar los síntomas en comparación con una línea base.
- Formular hipótesis que expliquen los síntomas con suposiciones mínimas.
- Seleccionar pruebas que refuten las hipótesis rápidamente con la menor intrusión posible.
- Cambiar una variable a la vez; confirmar la solución y monitorear para detectar regresiones.
- Documentar la causa raíz y las acciones preventivas.
Pistas capa por capa
- Capa 1: Potencia óptica, cableado, presupuestos de PoE, enlaces unidireccionales. En StackWise Virtual, LMP rechaza el reenvío unidireccional; investigue ópticas no coincidentes o polaridad de fibra incorrecta.
- Capa 2: Presencia de VLAN/VXLAN, estado de STP, MTU, MAC flaps. Las discrepancias en VNI/VNID de VXLAN se manifiestan como segmentos aislados con alcanzabilidad normal en la red subyacente (underlay).
- Capa 3: Subnetting, políticas de VRF/fuga de rutas (route-leak), comportamiento de gateway HSRP/GLBP/VSS, asimetría de ECMP. Una discrepancia entre la IP virtual de HSRP y la configuración del par impide el funcionamiento adecuado del gateway; alinee la IP virtual. GLBP o un par VSS permiten que todos los hosts de una VLAN usen gateways activos simultáneamente.
- Capas 4 a 7: ACL/NAT, TCP MSS/PMTUD, DNS/DHCP, handshake de aplicación, caídas de QoS. Valide la preservación de DSCP de extremo a extremo. Para multicast, confirme el estado de RP/Join.
- Especificidades del plano de control:
- Las adyacencias de OSPF fallan debido a discrepancias en el área, temporizadores, tipos de red o IP en enlaces punto a punto.
- Las sesiones BGP configuradas con MD5 deben tener contraseñas y peer-groups coincidentes en ambos lados; un mensaje de “invalid MD5 digest” indica una discrepancia o una alteración en tránsito.
- Las VPN de SD-WAN definen la segmentación; las políticas de datos dirigen los flujos basándose en campos e ID de VPN. vManage proporciona el plano de gestión único; verifique la intención frente al estado real.
- Incorporación inalámbrica (onboarding): Valide la seguridad del SSID (p. ej., WPA2/AES con 802.1X para el acceso de empleados), DHCP/DNS, canal/potencia de RRM y control de CAPWAP. Los errores de formato en la Opción 43 son bloqueadores comunes para la unión a la red.
Selección de pruebas y consideraciones
- Prefiera primero la telemetría y pings/trazas dirigidos; escale a la captura de paquetes cuando persistan múltiples hipótesis.
- Utilice historiales de estilo 360 de dispositivos y clientes para correlacionar cambios alineados en el tiempo (p. ej., una actualización de software o un cambio de canal de RRM) con la aparición de los síntomas.
Alta disponibilidad, ciclo de vida y mejora continua
Validación de la alta disponibilidad
- Núcleo del campus: Utilice enlaces redundantes de Capa 3 punto a punto entre los dispositivos del núcleo para una convergencia determinista y rápida. Valide los temporizadores del IGP, BFD y las rutas de igual costo.
- Supervisor SSO: Requiere sincronización de estado; combínelo con NSF para mantener el reenvío L3 ininterrumpido durante una conmutación por error. Pruebe la conmutación por error bajo carga y asegure la continuidad de FHRP/adyacencia.
- Redundancia de primer salto: Valide los temporizadores de HSRP/GLBP, la preemption y la consistencia de las IP virtuales entre pares.
- Bordes de SD-Access: Pruebe la alcanzabilidad externa y la publicación/traducción del fabric en los nodos de borde; verifique la segmentación basada en políticas a través de los límites.
Mantenimiento y gestión de cambios
- Pre-cambio: Defina un MOP con objetivos, plan de retroceso, criterios de éxito y plan de monitoreo. Realice una revisión por pares y programe dentro de una ventana de mantenimiento.
- Ejecución: Congele los cambios no relacionados. Implemente en radios de impacto pequeños con puntos de control. Suprima temporalmente las alertas no accionables.
- Post-cambio: Ejecute verificaciones posteriores contra las líneas base y los SLO durante al menos un ciclo de negocio; reactive las alertas y confirme la calidad de la señal.
Ciclo de vida de la imagen de software
- Mantenga imágenes de referencia (golden images) por plataforma, con validación criptográfica. Despliéguelas en un laboratorio o anillo piloto; capture líneas base funcionales y de rendimiento.
- Actualizaciones: Prefiera métodos compatibles con ISSU/SSO donde sea posible; de lo contrario, planifique actualizaciones continuas (rolling upgrades) que mantengan el flujo de tráfico a través de pares redundantes.
- Retroceso (Rollback): Conserve las últimas imágenes funcionales conocidas y las instantáneas de configuración; verifique las variables de arranque y las rutas de recuperación de ROMMON.
- Copias de seguridad: Automatice las copias de seguridad de la configuración en cada commit; almacénelas con control de versiones y diferencias entre cambios. Utilice comprobaciones de cumplimiento (compliance) para detectar desviaciones.
Análisis de causa raíz y mejora post-incidente
- RCA: Construya una línea de tiempo a partir de telemetría correlacionada, commits y registros del controlador; identifique el fallo iniciador único y los factores contribuyentes.
- Documentación: Capture el impacto, MTTR, indicadores, artefactos de prueba y acciones correctivas permanentes. Compártalo ampliamente.
- Mejora: Convierta las correcciones en políticas o automatización (p. ej., reglas de cumplimiento, plantillas). Agregue nuevos detectores si la señal era previamente invisible.
Métricas operativas y previsión de capacidad
- Salud: Disponibilidad, tiempo medio de detección/reparación, tasa de fallos en cambios, fidelidad de las alertas.
- Rendimiento: Pérdida/jitter por clase, percentiles de profundidad de cola, tasas de reintento de RF, tiempo de incorporación de clientes.
- Capacidad: Percentiles de utilización de interfaz, concurrencia de flujos, consumo de TCAM, margen de CPU/memoria, utilización del tiempo aire (airtime) de los AP.
- Previsión: Utilice NetFlow/IPFIX y las tendencias de telemetría para predecir cuándo se superarán los límites de los enlaces, las celdas de RF o la escala del plano de control. Planifique actualizaciones o cambios de política antes de que los SLO se deterioren.
Aseguramiento impulsado por el controlador
- Cisco DNA Center agrega información de dispositivos y clientes (trazado de ruta, vistas 360) y correlaciona datos de RF, conmutación, enrutamiento e identidad. Valida la intención frente al estado, señala configuraciones incorrectas y admite la remediación proactiva.
- En SD-WAN, vManage proporciona gestión desde un único panel, seguimiento de SLO para el enrutamiento consciente de la aplicación y auditorías para la conformidad de las políticas.
Escenario de problema práctico
Contoso Retail opera un campus de tres niveles con SD-Access para la segmentación y un controlador inalámbrico centralizado. Los usuarios reportan problemas intermitentes de calidad de voz y fallos ocasionales en la incorporación a la red Wi‑Fi en dos edificios.
Enfoque
Definir el alcance y los SLO
- Identificar los servicios afectados: VoIP en la VPN 10 (segmento de voz) y el SLO de tiempo de incorporación a Wi-Fi (<7 segundos).
- Justificación: Unos SLO claros permiten la selección de señales específicas y una prueba de aceptación de pasa/falla para la corrección.
Correlacionar telemetría y eventos
- Revisar DNA Center Assurance: salud de la ruta de voz, líneas de tiempo del cliente 360 y dispositivo 360 para los switches de distribución.
- Extraer telemetría en tiempo real (streaming telemetry) para caídas por clase y métricas de RF; consultar NetFlow/IPFIX para la ruta de los flujos de voz con DSCP EF.
- Justificación: La correlación de múltiples fuentes alineadas en el tiempo reduce las conjeturas y saca a la luz la primera desviación.
Validar el underlay de Capa 1–3 y la alta disponibilidad (HA)
- Ejecutar un trazado de ruta entre los terminales de voz; verificar los enlaces redundantes L3 P2P del núcleo y los temporizadores de IGP/BFD para una conmutación por error rápida.
- Comprobar el estado de StackWise Virtual y los registros de LMP en busca de rechazos de enlaces unidireccionales en el par de distribución.
- Justificación: Fallos unidireccionales sutiles o una convergencia lenta pueden manifestarse como deterioros transitorios de la voz.
Verificar el primer salto y la política de QoS
- Inspeccionar HSRP/GLBP para la VLAN de voz; confirmar la consistencia de la IP virtual y la preemption. Validar el remarcado de DSCP EF y la conformidad de la política de colas en las interfaces de egreso.
- Justificación: Una desalineación del gateway o una QoS mal aplicada causa jitter, pérdida y enrutamiento asimétrico para el tráfico en tiempo real.
Analizar la incorporación inalámbrica
- Examinar los registros del WLC en busca de cambios de RRM y la estabilidad de la unión de los AP. Confirmar la codificación de la opción 43 de DHCP para las VLAN de AP remotos y asegurar que
ip helper-addressesté configurado. - Validar la postura de seguridad del SSID (WPA2/AES con 802.1X) y la latencia de autenticación en los registros del controlador y de identidad.
- Justificación: Un formato incorrecto de la opción 43 y cambios excesivos de canal/potencia por RRM prolongan la incorporación y aumentan los reintentos.
- Examinar los registros del WLC en busca de cambios de RRM y la estabilidad de la unión de los AP. Confirmar la codificación de la opción 43 de DHCP para las VLAN de AP remotos y asegurar que
Inspeccionar el overlay y los bordes de SD-Access
- Verificar los mapeos de VNID para la VPN 10 y las publicaciones del nodo de borde del fabric hacia los servicios externos (controladores de llamadas).
- Justificación: Desajustes de VNI/VNID o problemas de traducción en el borde aíslan los terminales de voz a pesar de tener un underlay saludable.
Ejecutar pruebas dirigidas
- Colocar sondas de voz sintéticas que midan pérdida/jitter; capturar un ERSPAN corto desde una interfaz de egreso que muestre caídas en la cola EF durante los picos.
- Justificación: La prueba objetiva vincula los síntomas con interfaces y colas específicas.
Remediar y validar
- Reemplazar un par de fibra sospechoso señalado por LMP; alinear la IP virtual de HSRP con el estándar documentado; ajustar los intervalos de cambio de RRM; corregir la opción 43 de DHCP a hexadecimal en los ámbitos afectados.
- Reaplicar las plantillas de QoS asegurando el ancho de banda mínimo para EF y que WRED esté deshabilitado para EF.
- Justificación: Aborda las fallas de raíz y aplica las mejores prácticas para el tráfico en tiempo real.
Monitoreo post-cambio y RCA
- Hacer seguimiento de los SLO de voz y el tiempo de incorporación durante un día hábil completo. Documentar la causa raíz (enlace unidireccional causando micro-convergencia, desviación de la VIP de HSRP, opción 43 malformada) y los controles preventivos (certificación de fibra, comprobaciones de cumplimiento de configuración, validación de ámbitos DHCP).
- Justificación: Confirma la recuperación sostenida e institucionaliza los aprendizajes como políticas y automatización.
← Automatización · Todos los dominios
Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Aprueba tu examen →