Amazon DEA-C01: Optimización de costos para cargas de trabajo de datos — Guía de estudio

Forma parte de la Amazon Data Engineer Associate DEA-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

La optimización de costos para las cargas de trabajo de datos asegura que las canalizaciones de almacenamiento, computación y procesamiento de datos entreguen valor sin gastos descontrolados. Los ingenieros de datos deben equilibrar el rendimiento de las consultas, la durabilidad de los datos y la disponibilidad frente a modelos de precios que varían según el servicio y el patrón de uso. Este dominio requiere familiaridad con las clases de almacenamiento y las políticas de ciclo de vida, los controles a nivel de consulta y de clúster, la capacidad spot y reservada, y las ventajas y desventajas entre los modelos sin servidor (serverless) y aprovisionados.

Optimización de costos de almacenamiento en S3

S3 Intelligent-Tiering es la opción predeterminada recomendada para conjuntos de datos con patrones de acceso impredecibles: habilite Intelligent-Tiering a través de la consola o la AWS CLI cuando la frecuencia de acceso a los objetos no se pueda prever de manera fiable. Configure Intelligent-Tiering siendo consciente de la tarifa de monitoreo/automatización correspondiente (hay un pequeño cargo mensual de monitoreo por objeto) y el número mínimo de días adecuado para las transiciones automáticas de nivel (30 días para los niveles de acceso frecuente a poco frecuente). Use etiquetas de objeto y reglas de ciclo de vida para excluir objetos pequeños y de alta solicitud donde las tarifas de monitoreo superarían los ahorros.

Utilice estos patrones operativos para reducir los gastos de S3:

undefined

) para identificar patrones de acceso a nivel de prefijo/etiqueta antes de crear reglas de ciclo de vida.

Criterios de decisión:

Gestión de costos de Athena y Redshift

Los costos de Athena escalan con los bytes escaneados. Aplique controles de grupo de trabajo (consola o

undefined

) para implementar límites de datos escaneados por consulta y presupuestos mensuales por grupo de trabajo; habilite “Enforce workgroup settings” para que las consultas que excedan el límite de datos por consulta fallen en lugar de ejecutarse. Reduzca los bytes escaneados convirtiendo los archivos de origen a formatos columnares comprimidos (Parquet/ORC), particionando por fecha o columnas de filtro comunes, aplicando predicate pushdown y usando CTAS o CREATE TABLE AS para materializar conjuntos de datos optimizados. Utilice la reutilización de resultados de consultas y el aislamiento de cargas de trabajo en grupos de trabajo separados para evitar fugas de costos entre equipos.

Las decisiones de costos de Redshift dependen de la previsibilidad de la carga de trabajo y las opciones de almacenamiento. Para un uso de computación de data warehouse estable y predecible, adquiera Reserved Nodes (plazos de uno o tres años, opciones de pago parcial/total por adelantado) para asegurar descuentos en comparación con el modelo bajo demanda (on-demand). Para cargas de trabajo variables:

Aspectos destacados de la comparación:

Estrategias de costos para Glue y EMR

AWS Glue proporciona ETL sin servidor (serverless) con múltiples palancas de costo. Para trabajos por lotes (batch) que no son sensibles a la latencia, use la ejecución flexible de Glue (trabajos Glue Flex), que puede reducir el costo hasta en un ~34% en comparación con la ejecución estándar de Glue. Configure los parámetros del trabajo de Glue en Glue Studio o la CLI (

undefined

) para seleccionar el tipo de worker y el máximo de DPUs, establezca un límite máximo de DPU sensato para evitar el autoescalado ilimitado y use marcadores de trabajo (job bookmarks) para evitar el reprocesamiento completo. Para cargas de trabajo interactivas o sensibles a la latencia, elija los tipos de worker (Standard/G.1X/G.2X) y ajuste el paralelismo de manera responsable.

La reducción de costos en EMR se basa en el uso de Spot Instances para los nodos de tarea (task nodes) mientras se mantienen los nodos maestros y principales (master and core nodes) como On-Demand (configure flotas de instancias o grupos de instancias en la consola o mediante

undefined

). Use Spot solo para los nodos de tarea, seleccione la estrategia de asignación optimizada para la capacidad (capacity-optimized) y establezca un precio máximo/de oferta apropiado si usa Spot con licitación. Proteja el estado del clúster y la resiliencia del trabajo mediante:

Criterios de decisión:

Capacidad reservada y Savings Plans para servicios de datos

La capacidad reservada y los Savings Plans se aplican de manera diferente entre los servicios de datos. Para los servicios basados en EC2 (EMR, HBase autogestionado, Hadoop personalizado), utiliza EC2 Savings Plans o Instancias reservadas para cubrir el gasto de computación; selecciona opciones regionales o zonales según las necesidades de movilidad. Redshift admite la compra de nodos reservados para clústeres aprovisionados con el fin de reducir los costos por hora en cargas de trabajo de data warehouse predecibles. Los servicios sin servidor (serverless) como Glue y Athena no tienen reservas de recursos; en su lugar, optimiza mediante la programación de cargas de trabajo y cambios en el formato de datos.

Guía práctica de compra:

Errores comunes y criterios de decisión

undefined

) y elige los tipos de worker apropiados para mantener los costos predecibles.

Problema práctico: Reducción de costos del ETL nocturno de Acme Analytics

Acme Analytics ejecuta un ETL nocturno y análisis ad-hoc diarios; el gasto mensual en la nube se ha disparado debido al creciente almacenamiento de datos crudos en S3 y a las horas de Redshift bajo demanda (on-demand). La empresa necesita una reducción del 35% sin afectar los SLAs nocturnos.

  1. Ejecuta un Análisis de clases de almacenamiento de S3 (Storage Class Analysis) y reglas de ciclo de vida para mover los archivos crudos fríos de más de 90 días a Glacier Flexible Retrieval (planifica recuperaciones masivas (Bulk)/estándar (Standard)).
  2. Convierte los CSV crudos a formato Parquet particionado y comprimido, y compacta los archivos pequeños; almacena los conjuntos de datos optimizados bajo prefijos separados para Athena/Redshift Spectrum.
  3. Crea grupos de trabajo (workgroups) de Athena con límites de datos escaneados por consulta y fuerza la configuración del grupo de trabajo; habilita la reutilización de resultados de consulta y establece un presupuesto mensual por grupo de trabajo.
  4. Migra el ETL por lotes a trabajos Glue Flex para transformaciones no urgentes, establece límites máximos de DPU y prográmalos durante horas de menor actividad; conserva una flota estándar de Glue más pequeña para trabajos urgentes.
  5. Dimensiona correctamente (Right-size) Redshift: compra Nodos reservados de 1 año para la computación base estable, mueve los datos históricos a S3 y usa Spectrum para consultas poco frecuentes, y habilita el escalado de concurrencia solo con monitoreo.

Justificación: La estrategia combina la optimización del formato de datos y del ciclo de vida (reduciendo los costos de almacenamiento y escaneo), la ejecución sin servidor de menor costo para trabajos flexibles (Glue Flex), la gobernanza de consultas (grupos de trabajo de Athena) y la capacidad reservada para computación sostenida para maximizar los descuentos, preservando al mismo tiempo la disponibilidad y el rendimiento.


Monitoreo y resolución de problemas de pipelines de datos · Todos los dominios · Calidad

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo