Amazon DEA-C01: Consulta y análisis de datos — Guía de estudio

Forma parte de la Amazon Data Engineer Associate DEA-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Este dominio abarca el diseño, el ajuste y la operación de servicios de AWS que soportan consultas analíticas y BI sobre grandes conjuntos de datos. Se centra en patrones de consulta rentables y de alto rendimiento en Athena, Redshift, OpenSearch y QuickSight, y en cómo interoperan con S3, Glue y almacenes transaccionales. Dominarlo requiere equilibrar el formato de almacenamiento, el particionamiento, el tipo de cómputo y la ubicación de los datos para minimizar los bytes escaneados y el desequilibrio de red (network skew), mientras se entrega información (insights) de baja latencia.

Optimización de consultas en Amazon Athena

La tarificación de Athena se basa en los bytes escaneados, por lo que la disposición física de los datos y los metadatos son las palancas principales. Utilice formatos columnares (Parquet u ORC) con compresión (Snappy para Parquet, opciones Zlib/ORC) para reducir el tamaño y el uso de CPU. Particione los datos por columnas de alta cardinalidad que se usan para filtrar en las consultas (fecha, región) y registre las particiones en el Glue Data Catalog. Patrones típicos:

undefined

para poblar las particiones.

undefined

para forzar la compresión columnar.

Cuando las consultas requieren uniones (joins) con almacenes transaccionales, use Athena Federated Query (conectores Lambda) para realizar uniones entre diferentes fuentes con RDS, DynamoDB o Redshift. Los conectores se despliegan como funciones Lambda y se registran como fuentes de datos en Athena; flujo de ejemplo en la consola: Athena > Data sources > Connectors > New. Criterios de decisión:

Ajuste de consultas y distribución en Amazon Redshift

El rendimiento de Redshift depende del estilo de distribución y de las claves de ordenación (sort keys) para minimizar el movimiento de datos y habilitar los mapas de zona (zone maps). Elija los estilos de DIST usando estos puntos de decisión:

Defina SORTKEYs en las columnas utilizadas en filtros de rango o en ORDER BY para habilitar los mapas de zona y reducir las lecturas de disco. Comandos operativos comunes:

undefined

undefined

; monitoree

undefined

y

undefined

para métricas de desequilibrio (skew) y distribución. Redshift Spectrum le permite consultar tablas externas de S3 a través del Glue Data Catalog. Cree el esquema externo con:

undefined

Criterios de decisión para Spectrum frente a Redshift nativo:

Amazon OpenSearch Service para análisis de logs

OpenSearch está optimizado para la ingesta y el análisis rápido y ad-hoc de logs; la configuración de sus índices y clúster determina el rendimiento (throughput) y el costo. Diseño y ciclo de vida de los índices:

undefined

y una plantilla de índice para establecer

undefined

(índices pequeños: 1 shard; grandes: múltiples shards de ~10–50 GB de tamaño) y

undefined

para la disponibilidad.

QuickSight para BI y visualización

QuickSight proporciona dashboards rápidos con dos modos principales de ingesta: SPICE (en memoria) y consulta directa (direct query). SPICE ofrece un rendimiento por debajo del segundo para los dashboards y es adecuado para lecturas repetidas; las consultas SQL directas (a Athena, Redshift, RDS) son preferibles para conjuntos de datos muy grandes o datos que cambian con frecuencia. Configuración clave y mejores prácticas:

Errores Comunes y Criterios de Decisión

Problema Práctico: Escenario de Caso de Uso

Acme Retail necesita informes de BI diarios que combinen pedidos transaccionales en Amazon RDS, eventos de clickstream en S3 y perfiles de usuario de DynamoDB, con límites de costo y actualizaciones de dashboards en menos de un minuto para los datos recientes.

  1. Convertir los datos de clickstream de S3 a formato Parquet particionado (basado en fecha), comprimir con Snappy y registrar los metadatos en AWS Glue a través de un crawler.
  2. Usar Athena para consultas ad-hoc sobre S3 e implementar conectores de consulta federada (Federated Query) para RDS y DynamoDB para realizar uniones con dimensiones pequeñas; materialice los resultados de uniones frecuentes como Parquet si las consultas se repiten.
  3. Aprovisionar Redshift para uniones analíticas pesadas: cargue instantáneas agregadas (snapshots) en Redshift, establezca la DISTKEY en un customer_id de alta cardinalidad y defina la SORTKEY en order_date; use Spectrum para datos históricos fríos de S3.
  4. Ingerir los logs de la aplicación en OpenSearch con patrones de índice diarios; aplique ILM para mantener los índices recientes en nodos calientes (hot nodes) y mover los índices más antiguos a UltraWarm para ahorrar costos.
  5. Construir dashboards en QuickSight: importe agregados recientes a SPICE con actualizaciones incrementales programadas para una capacidad de respuesta percibida de menos de un minuto, y use consultas directas (direct queries) para métricas siempre actualizadas.

Justificación: Este enfoque minimiza los costos de escaneo de Athena mediante la partición y los formatos columnares, reduce el barajado de red (network shuffle) de Redshift con claves de distribución y ordenación adecuadas, usa Spectrum para evitar almacenar datos fríos en Redshift, aplica ILM de OpenSearch para optimizar el costo de almacenamiento y aprovecha SPICE para dashboards responsivos mientras mantiene la frescura crítica a través de consultas directas.


Orquestación de datos y gestión de flujos de trabajo · Todos los dominios · Seguridad

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo