Amazon SAP-C02: Almacenamiento y Gestión de Datos — Guía de estudio
Forma parte de la AWS Solutions Architect Professional SAP-C02 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.
Almacenamiento de objetos, ciclo de vida y clasificación por niveles (Amazon S3 y servicios relacionados)
Amazon S3 es la base para el almacenamiento de objetos duradero y de alta disponibilidad, y debe tratarse como el almacén canónico a largo plazo para datos no estructurados. Las decisiones de diseño se centran en la selección de la clase de almacenamiento, las reglas de ciclo de vida, la semántica de consistencia y la gobernanza de datos. Elija S3 Standard para objetos de acceso frecuente, Intelligent-Tiering cuando los patrones de acceso son desconocidos, Standard-IA o One Zone-IA para acceso poco frecuente, y Glacier/Deep Archive para retención a largo plazo con una mayor latencia de restauración. Implemente políticas de ciclo de vida basadas en etiquetas o prefijos para transferir objetos automáticamente y para que expiren las versiones antiguas; habilite el control de versiones antes del ciclo de vida o la replicación para que los objetos no se eliminen accidentalmente. Use Cross-Region Replication (CRR) para durabilidad geográfica y ubicación regulatoria, o Same-Region Replication (SRR) para cumplimiento y separación de responsabilidades. Proteja los archivos críticos con S3 Object Lock en modo de gobernanza o cumplimiento y habilite MFA Delete cuando sea apropiado. Las trampas comunes incluyen transiciones de ciclo de vida demasiado agresivas que incurren en cargos de restauración y retrasos de minutos a horas, no tener en cuenta los costos o tiempos de recuperación de Glacier, y depender de puntos de conexión (endpoints) públicos en lugar de puntos de conexión de VPC de tipo Gateway o Interface (lo que puede exponer los datos a la Internet pública o incurrir en costos de salida de NAT). Equilibre el costo frente a la latencia de recuperación y la durabilidad: clasifique por niveles de forma agresiva para los datos fríos, pero aprovisione aceleración (CloudFront, S3 Transfer Acceleration, cargas multiparte) para la entrada de datos calientes y el acceso de baja latencia donde sea necesario.
Sistemas de archivos compartidos y almacenamiento de alto rendimiento (EFS, FSx)
Elija sistemas de archivos compartidos cuando las aplicaciones requieran semántica POSIX, baja latencia o semántica SMB. Amazon EFS proporciona NFS elástico con durabilidad multi-AZ y consistencia POSIX, adecuado para contenido web, directorios de inicio (home directories) y muchas cargas de trabajo de HPC que toleran la semántica de archivos de red. EFS tiene dos modos de rendimiento (Bursting y Provisioned throughput) y transiciones de ciclo de vida a EFS Infrequent Access. Amazon FSx ofrece sistemas de archivos diseñados para fines específicos: Windows File Server para la integración con SMB/Active Directory, y FSx for Lustre para una latencia inferior al milisegundo y un alto rendimiento para cargas de trabajo de HPC y multimedia estrechamente acopladas; FSx Lustre puede vincularse de forma transparente a S3 para obtener un repositorio de datos duradero. Elija FSx for Windows cuando necesite semántica NTFS, ACL de AD, espacios de nombres DFS o herramientas exclusivas de Windows; elija FSx for Lustre para granjas de renderizado y entrenamiento de ML que requieran un alto número de IOPS y rendimiento. Los errores operativos comunes incluyen asumir que EFS manejará automáticamente las cargas de trabajo con muchos metadatos (es posible que necesite rendimiento aprovisionado), abrir ampliamente los puertos NFS/SMB en los grupos de seguridad y descuidar las opciones de montaje y los tiempos de espera del cliente. Evalúe las compensaciones: FSx tiene un costo más alto pero un mayor rendimiento y características de protocolo más ricas; EFS es más simple de escalar y es duradero en múltiples AZ. Haga coincidir los patrones de E/S de la carga de trabajo, la concurrencia y las necesidades de rendimiento con el sistema elegido, y dimensione el rendimiento por separado cuando sea necesario.
Patrones de transferencia híbrida y sin conexión (Storage Gateway, DataSync, familia Snow)
Las arquitecturas híbridas suelen requerir almacenamiento en caché local de baja latencia, copias de seguridad en la nube sin interrupciones o migración de datos en bloque. AWS Storage Gateway ofrece tres patrones: File Gateway expone S3 como NFS/SMB para que las aplicaciones locales (on-prem) escriban en S3; Volume Gateway expone volúmenes de bloque para recuperación ante desastres (DR); Tape Gateway reemplaza las cintas físicas. AWS DataSync automatiza el movimiento de datos en línea, incremental y en paralelo entre entornos locales (on-prem) y AWS (S3, EFS, FSx) con controles integrados de filtrado, programación y ancho de banda; respeta los metadatos POSIX cuando se configura. Para transferencias sin conexión y de muy gran tamaño, la familia Snow proporciona dispositivos de borde y de transporte que incluyen capacidad de cómputo: Snowcone para sitios remotos pequeños, Snowball Edge para decenas o cientos de TB con Lambda/EC2 en el dispositivo, y Snowmobile para importaciones de exabytes. Use DataSync para transferencias continuas y automatizadas, y Storage Gateway File Gateway cuando las aplicaciones heredadas deban ver montajes NFS/SMB localmente mientras almacenan los datos en S3. Los errores comunes incluyen usar el modo de gateway incorrecto (en caché frente a almacenado - cached vs stored), no planificar el rendimiento de la red, lo que conduce a migraciones largas, descuidar los roles de IAM y las políticas de punto de conexión para una transferencia segura, y subestimar los tiempos de ingesta/salida de los dispositivos Snow. Elija DataSync para sincronizaciones incrementales frecuentes, Storage Gateway para compatibilidad con protocolos locales y los dispositivos Snow para transferencias en bloque o remotas donde el ancho de banda de la red es insuficiente.
Copias de seguridad, replicación, control de acceso y gobernanza operativa
La elección de las copias de seguridad y la replicación debe basarse en los objetivos de RTO/RPO, los controles normativos y el costo. Utilice AWS Backup para centralizar las políticas de copia de seguridad en EBS, RDS, DynamoDB, EFS y FSx, y configure transiciones de ciclo de vida desde el almacén tibio (warm vault) al almacenamiento en frío (cold storage) para ahorrar costos. Para las bases de datos, prefiera los mecanismos nativos (snapshots de RDS, réplicas de lectura o DMS para migraciones heterogéneas) junto con la copia de snapshots entre regiones y la replicación de claves de KMS o políticas de clave separadas. Para S3, habilite el versionamiento, CRR/SRR, y considere el control de tiempo de replicación (RTC) cuando se requiera un SLA de replicación casi en tiempo real. Los patrones de acceso seguro se basan en IAM con privilegios mínimos, políticas de bucket, S3 Block Public Access, VPC Gateway/Interface endpoints con políticas de endpoint y KMS con permisos detallados (grants) para el acceso entre cuentas y la copia de snapshots. Supervise con CloudTrail, S3 Access Logs, métricas de CloudWatch, reglas de AWS Config, y utilice GuardDuty y Access Analyzer para la detección de amenazas y configuraciones incorrectas de IAM. Las trampas típicas incluyen no replicar o conceder acceso a las CMK de KMS entre cuentas, dejar los snapshots sin cifrar o accesibles públicamente, y no forzar el uso de etiquetas o la ubicación de recursos con SCPs y Tag Policies, lo que complica la asignación de costos y la recuperación. Decida en función de las necesidades de resiliencia: multirregión activo-activo para el RTO más bajo, pilot-light/warm standby para un DR rentable, y full failover cuando el RTO deba ser mínimo.
Problema práctico: Escenario de caso de uso
Escenario: Atlas Media opera una AWS Organization multicuenta con producción en us‑east‑1 y una región secundaria en eu‑west‑1. Tienen un archivo on-premise de 150 TB de activos de video, y los artistas en Norteamérica y Europa requieren almacenamiento compartido de alto rendimiento y acceso seguro de baja latencia a los proyectos actuales.
Desafío: Migrar el archivo a AWS, proporcionar almacenamiento de renderizado de alto rendimiento para los artistas, minimizar los costos de almacenamiento continuo para los activos fríos y garantizar un acceso seguro entre regiones con copias de seguridad robustas.
Enfoque recomendado:
- Aprovisione un bucket de S3 en us‑east‑1 como el archivo canónico, habilite el versionamiento, el cifrado del lado del servidor con AWS KMS (SSE‑KMS) y configure la Cross‑Region Replication a eu‑west‑1 con la replicación de los marcadores de eliminación (
delete markers) activada. - Utilice dispositivos AWS Snowball Edge para importar los 150 TB iniciales a S3 (Snowball Edge optimizado para almacenamiento), y luego ejecute AWS DataSync para la sincronización incremental de cualquier cambio delta y para validar la integridad.
- Para los conjuntos de trabajo activos, despliegue Amazon FSx for Lustre en cada región y vincule el sistema de archivos al bucket de S3 (Integración de Repositorio de Datos) para que los artistas obtengan un alto rendimiento y baja latencia mientras las escrituras se sincronizan de vuelta a S3; considere usar instancias de FSx de corta duración para picos de trabajo en proyectos.
- Aplique el acceso seguro con VPC Interface Endpoints para S3 y FSx, restrinja el acceso al bucket con roles de IAM y políticas de bucket vinculadas a principales (
principals) de la Organization, gestione la distribución pública con CloudFront y URLs firmadas para revisores remotos, y habilite AWS Backup para FSx además de la replicación entre regiones de S3 y reglas de ciclo de vida para hacer la transición de los activos fríos a Glacier Deep Archive.
Justificación: Este enfoque separa el almacenamiento de archivo duradero y de bajo costo (S3 + Glacier) del almacenamiento de proyectos de alto rendimiento (FSx Lustre vinculado a S3), utiliza Snowball y DataSync para optimizar la ingesta masiva inicial y los deltas, y aplica una seguridad sólida y resiliencia entre regiones mientras equilibra los objetivos de costo, rendimiento y recuperación.
← Cómputo y Auto Scaling · Todos los dominios · Bases de Datos y Análisis →
Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Aprueba tu examen →