Google ACE: Compute Engine y operaciones de máquinas virtuales — Guía de estudio
Forma parte de la Google Associate Cloud Engineer — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Google, o realiza tests cronometrados en ExamRoll.io.
Descripción general
Compute Engine proporciona máquinas virtuales flexibles y de alto rendimiento, así como primitivas de orquestación para ejecutar cargas de trabajo de uso general y especializadas. La excelencia operativa en Compute Engine implica seleccionar la familia de máquinas y el disco correctos, modelar el ciclo de vida de las instancias con plantillas y grupos de instancias, establecer una autorreparación y un autoescalado robustos, reforzar las rutas de acceso y prepararse para los modos de fallo con procedimientos de recuperación repetibles. Esta sección explica las decisiones de diseño, las compensaciones y los patrones operativos que minimizan el trabajo manual y maximizan la fiabilidad y la rentabilidad.
Tipos de máquina, dimensionamiento y ciclo de vida de la instancia
Familias de máquinas
- De uso general: E2 (optimizadas en costes), N2 (equilibradas), N2D (basadas en AMD), Tau T2D/T2A (alta relación precio-rendimiento para escalado horizontal), adecuadas para la mayoría de las cargas de trabajo.
- Optimizadas para el cálculo: C3 para tareas que hacen un uso intensivo de la CPU; elígelas cuando necesites un alto rendimiento por núcleo.
- Optimizadas para memoria: Serie M para bases de datos en memoria y analítica.
- GPU y aceleradores: Asócialos a familias compatibles cuando necesites aceleración CUDA o ML; asegúrate de que la inicialización del controlador esté contemplada en los procesos de inicio.
Tipos de máquina personalizados
- Usa vCPU y memoria personalizadas para dimensionar correctamente las cargas de trabajo y reducir el desperdicio, especialmente para necesidades asimétricas (p. ej., alto consumo de memoria pero moderado de CPU).
- Para servicios que hacen un uso intensivo de la CPU, prefiere recuentos de vCPU más altos; para los que hacen un uso intensivo de la memoria, aumenta la RAM y asegúrate de que los recolectores de basura y las cachés estén ajustados.
- Presta atención a los modelos de licenciamiento vinculados al número de núcleos; los tipos personalizados ayudan a evitar núcleos con licencia innecesarios.
Dimensionamiento de la carga de trabajo
- Parte de los perfiles de recursos medidos en entornos de desarrollo o anteriores: utilización de CPU en P95, nivel máximo de memoria, rendimiento/IOPS del disco, ancho de banda de la red.
- Para tráfico con picos, planifica una capacidad adicional o usa el autoescalado; para un estado estable, apunta a una utilización del 60–70% en el pico para equilibrar coste y resiliencia.
- Evalúa las VMs Spot (preemptibles) para trabajos por lotes y tolerantes a fallos; pueden ser terminadas en cualquier momento, así que diseña con puntos de control (checkpointing) y reintentos.
Recursos del ciclo de vida de la instancia
- Instancias de VM: El recurso de cómputo atómico. Usa etiquetas y una nomenclatura coherente para impulsar la automatización.
- Plantillas de instancia: Planos inmutables que capturan el tipo de máquina, los discos, las cuentas de servicio, los metadatos y los scripts de inicio; son la base de los grupos de instancias gestionados y garantizan despliegues repetibles.
- Grupos de instancias gestionados (MIG): Proporcionan tamaño declarativo, autoescalado, autorreparación, actualizaciones progresivas, distribución regional (multizona) y configuración por instancia. Prefiere los MIG para patrones sin estado y con estado (los MIG con estado conservan los discos/IP seleccionados).
- Grupos de instancias no gestionados: Colecciones simples para el balanceo de carga de conjuntos heredados; carecen de autoescalado/autorreparación. Úsalos solo cuando necesites registrar VMs gestionadas de forma independiente.
Disponibilidad, autoescalado y mantenimiento
Autoescalado
- Señales: Utilización de la CPU, solicitudes por segundo por instancia del balanceador de carga HTTP, métricas de Cloud Monitoring y profundidad de la cola. Elige una señal estrechamente correlacionada con la saturación; la CPU es una buena base para cargas de trabajo homogéneas que hacen un uso intensivo de la CPU.
- Periodos de enfriamiento y estabilización: Configúralos para evitar la oscilación (thrashing). Si tu aplicación tarda minutos en inicializarse, aumenta el retraso inicial del MIG y establece un periodo de enfriamiento de autoescalado adecuado.
- Patrones de instancia única: Para forzar exactamente una VM, establece min=1 y max=1 en el autoescalado de un MIG. Esto preserva el estado de salud mientras habilita la autorreparación.
Autorreparación y comprobaciones de estado
- Comprobaciones de estado: Usa comprobaciones HTTP(S) para la vitalidad (liveness) de la aplicación; TCP solo valida la aceptación de sockets. Implementa un endpoint de estado que ponga a prueba las dependencias críticas.
- Umbrales e intervalos: Ajusta el intervalo de comprobación y los umbrales para detectar fallos rápidamente sin falsos positivos.
- Retraso inicial: Establece el retraso inicial de autorreparación del MIG con una duración suficiente para el arranque y la inicialización, a fin de evitar reemplazos prematuros de instancias sanas que se están poniendo en línea.
- Modos de fallo: Endpoints de estado mal configurados y retrasos iniciales demasiado cortos causan inestabilidad (flapping) y sobreaprovisionamiento.
MIG regionales y distribución
- Los MIG regionales distribuyen las instancias en múltiples zonas de una región, proporcionando tolerancia a fallos de zona. Elige el número de réplicas objetivo por zona basándote en la planificación de capacidad.
- Usa configuraciones por instancia y políticas con estado (stateful) cuando se requiera conservar discos o IPs; comprende que el reemplazo de VMs puede ser más lento debido a la reconciliación de estado.
Mantenimiento, migración en vivo y reservas
- Migración en vivo: Es la opción por defecto para la mayoría de las VMs; las instancias se mueven durante el mantenimiento del host sin necesidad de reinicio. Para cargas de trabajo que no pueden tolerar la migración (p. ej., HFT sensible a la latencia), establece la política de mantenimiento en “terminar” y confía en la autorreparación.
- Las ventanas de mantenimiento del host son transparentes con la migración en vivo, pero aun así generan eventos; monitoriza y prueba.
- Reservas: Crea reservas zonales para garantizar la capacidad para lanzamientos críticos o SLOs estrictos. Aplica un consumo de reserva “específico” o “cualquiera” según tu gobernanza. Las reservas son garantías de capacidad; combínalas con descuentos por uso confirmado para la planificación de costes.
Almacenamiento, imágenes y rendimiento
Persistent disks
- Tipos: Standard (HDD) para rendimiento secuencial a bajo costo; Balanced (pd-balanced) para uso general; SSD (pd-ssd) para IOPS altos y baja latencia; Extreme (pd-extreme) para IOPS y rendimiento aprovisionados en niveles de alto desempeño. Los Regional PDs proporcionan replicación síncrona entre zonas para una mayor disponibilidad.
- El rendimiento escala con el tamaño del disco para standard, balanced y SSD; aprovisiona el tamaño previamente para cumplir con los picos de IOPS/rendimiento o usa Extreme para aprovisionar explícitamente.
- El modo de solo lectura multi-adjunto (Multi-attach read-only) permite compartir conjuntos de datos entre muchas VMs; coordina el acceso y las capas de caché correspondientemente.
Local SSD
- Efímero, conectado directamente al host, IOPS muy altos y latencia muy baja. Los datos se pierden al detener, terminar o migrar la instancia. Úsalo para espacio temporal (scratch), cachés y capas de datos replicados. Asegura la replicación o los puntos de control (checkpoints) a nivel de aplicación.
Snapshots and images
- Las instantáneas (snapshots) son copias de seguridad incrementales y puntuales en el tiempo de los discos persistentes; prográmalas con Resource Manager o gcloud para cumplir con el RPO. El almacenamiento entre regiones soporta la recuperación ante desastres (DR).
- Las imágenes capturan los discos de arranque más la configuración. Mantén un pipeline de imágenes fortalecidas (hardened) y gestionadas con parches. Valida los agentes de invitado (para logging/monitoring) dentro de tus imágenes base (golden images).
- Patrones de restauración: Para una recuperación rápida, mantén imágenes base pequeñas y configura el resto mediante scripts de inicio o cloud-init; esto reduce la deriva (drift) y acelera las actualizaciones.
Disk choices: trade-offs and failure modes
- Los discos subaprovisionados limitan el rendimiento de la aplicación; el sobreaprovisionamiento desperdicia costos. Mide las características reales de E/S (I/O) y elige el disco más pequeño que cumpla con las necesidades pico con un margen.
- Para bases de datos, considera Regional PDs y pd-ssd/pd-extreme; valida el comportamiento de fsync y las profundidades de cola (queue depths). Evita Local SSD para estado duradero a menos que esté replicado.
Acceso, seguridad, redes y cargas de trabajo especializadas
Linux and Windows administration
- Linux SSH: Prefiere OS Login para centralizar la autorización SSH y atribuir el acceso a identidades. Otorga compute.osLogin o compute.osAdminLogin a grupos, no a individuos.
- Windows RDP: Establece las credenciales de Windows en la consola o mediante gcloud; asegúrate de que las reglas de firewall permitan TCP 3389 solo desde IPs de confianza. Usa el reenvío TCP de IAP (IAP TCP forwarding) para evitar la exposición pública.
- Consola serie: Habilítala como una vía de acceso de emergencia (break-glass); usa gcloud compute connect-to-serial-port para depurar el arranque. Restringe con IAM y audita el acceso.
SSH, OS Login, and key management
- Habilita OS Login a nivel de proyecto o instancia con los metadatos enable-oslogin=TRUE. Los usuarios añaden su clave pública SSH a su cuenta de Google; IAM controla el acceso basado en roles.
- Para sudo/root, usa compute.osAdminLogin. Deshabilita las claves SSH para todo el proyecto si usas OS Login para evitar la deriva (drift).
Metadata, startup scripts, and cloud-init
- El servidor de metadatos proporciona datos de la instancia/proyecto y tokens de cuentas de servicio. Usa solo tokens con un alcance bien definido; nunca codifiques secretos directamente (hardcode).
- Scripts de inicio y cloud-init: Inician agentes (bootstrap), obtienen configuraciones y registran servicios. Haz que los scripts sean idempotentes y escribe los registros en la consola serie para diagnósticos.
- Los metadatos por instancia pueden anular la configuración de la plantilla; úsalos con cuidado para evitar desviaciones de configuración (configuration skew).
Service accounts and scopes
- Asigna una cuenta de servicio dedicada por carga de trabajo con roles de IAM de mínimo privilegio sobre los recursos requeridos (p. ej., storage.objectCreator en un bucket específico).
- Prefiere alcances (scopes) de API de Cloud amplios solo cuando IAM controla estrictamente el acceso; de lo contrario, restringe los alcances a las APIs mínimas.
Networking and addresses
- Las NICs pueden tener IPs solo internas o externas. Prefiere VMs privadas con Cloud NAT o IAP para el acceso saliente y administrativo.
- Reserva IPs internas estáticas para puntos de conexión estables como servidores de licencias; evita depender de direcciones efímeras.
- El balanceo de carga HTTP(S) externo (External HTTP(S) Load Balancing) termina el TLS en el borde de la red (edge); usa certificados gestionados y verificaciones de estado (health checks) para los MIGs de backend. Mantén la preparación del backend alineada con la verificación de estado y el retraso inicial del MIG.
Specialized workloads and isolation
- Shielded VMs: El arranque seguro (Secure boot), vTPM y el monitoreo de integridad mitigan los rootkits; habilítalas por defecto a menos que controladores incompatibles requieran lo contrario.
- Confidential VMs: El cifrado de memoria con AMD SEV protege los datos en uso; generalmente tienen una sobrecarga de rendimiento mínima, pero valida para aplicaciones sensibles a la latencia.
- Sole-tenant nodes: Hosts físicos dedicados para cumplimiento normativo (compliance), aislamiento del efecto ‘vecino ruidoso’ (noisy-neighbor) y afinidad de licencias. Planifica la fragmentación de la capacidad y un costo más alto.
Solución de problemas y operaciones de recuperación
Diagnósticos comunes
- Conectividad: Verifica las reglas de firewall, los permisos de las cuentas de servicio y las rutas. Usa las pruebas de conectividad de Network Intelligence Center.
- Problemas de arranque: Inspecciona los registros de la consola en serie, toma una captura de pantalla y revisa la salida del script de inicio. Deshabilita temporalmente el Arranque Seguro (Secure Boot) si hay controladores sin firmar que bloquean el arranque y luego corrígelo.
- Bloqueo de acceso: Para problemas de SSH con OS Login, confirma los roles de IAM y que las claves existan en las cuentas de usuario; usa la consola en serie para añadir un usuario como medida de emergencia (break-glass).
- Corrupción de disco: Desvincula el disco de arranque, vincúlalo a una VM de rescate, repara los sistemas de archivos, rota las credenciales y captura una imagen después de la corrección.
Comportamientos de los MIG y balanceadores de carga
- Sobreaprovisionamiento: Si las instancias necesitan un calentamiento prolongado, aumenta el retraso inicial del MIG y el período de enfriamiento (cooldown) del autoescalador; de lo contrario, podrías escalar horizontalmente debido a errores 4xx/5xx mientras la aplicación aún se está inicializando.
- Bucles de autorreparación (autohealing): Confirma la semántica del endpoint de estado y la preparación de las dependencias; escalona el inicio de las dependencias o añade reintentos.
Patrones de recuperación
- Recrea la instancia desde una plantilla o imagen; los patrones inmutables reducen el MTTR.
- Restaura los datos desde la última instantánea (snapshot) exitosa; valida el RPO/RTO con los requisitos del negocio.
- Para fallas regionales, realiza una conmutación por error (failover) a una zona o región diferente usando MIG regionales y replicación de instantáneas entre regiones.
Salvaguardas operacionales
- Reservas para capacidad crítica; usa alertas basadas en monitoreo sobre el consumo de reservas y la cuota.
- Auditoría y registro: Habilita los registros de actividad del administrador y de acceso a datos para servicios críticos. Atribuye el acceso a través de OS Login y cuentas de servicio.
Ejemplos cortos
- Reservar una IP
← Jerarquía de recursos · Todos los dominios · Contenedores →
Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Aprueba tu examen →