Un trabajo ETL debe procesar archivos .csv diarios que los usuarios colocan en un bucket de S3. Cada archivo es más pequeño que 100 MB. ¿Qué implementación es la más rentable?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Escribir un trabajo de shell de Python de AWS Glue. Usar pandas para transformar los datos..
Por qué esta es la respuesta
La opción más rentable es un trabajo de shell de Python de AWS Glue con pandas. Dado que los archivos son pequeños (menos de 100 MB), pandas es eficiente para la transformación de datos en memoria y no requiere los recursos de un clúster de Spark. AWS Glue Python Shell es un entorno sin servidor y rentable para ejecutar scripts de Python. Las otras opciones implican clústeres (EKS, EMR) o Spark (AWS Glue PySpark), que son más costosos y complejos para cargas de trabajo de datos pequeñas, ya que Spark está optimizado para grandes volúmenes de datos distribuidos. Una aplicación Python personalizada en EKS introduce gastos generales de gestión de infraestructura.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta