Una empresa ha aumentado considerablemente el volumen de archivos CSV almacenados en un bucket de Amazon S3. Los scripts y las consultas de transformación de datos se han vuelto mucho más lentos. Un ingeniero de ML debe implementar una solución que optimice los datos para el rendimiento de las consultas con la MENOR sobrecarga operativa. ¿Qué opción satisface este requisito?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Configurar un trabajo de extracción, transformación y carga (ETL) de AWS Glue para convertir los archivos .csv al formato Apache Parquet..
Por qué esta es la respuesta
Convertir los archivos CSV a Apache Parquet es la solución más eficaz. Parquet es un formato de almacenamiento de datos columnar optimizado para el rendimiento de consultas analíticas, ya que permite la lectura selectiva de columnas y utiliza técnicas de compresión avanzadas. AWS Glue es un servicio ETL sin servidor que puede realizar esta conversión con baja sobrecarga operativa. Dividir archivos CSV en objetos más pequeños (opción A) podría aumentar el número de objetos a gestionar sin mejorar inherentemente el rendimiento de las consultas, ya que el formato sigue siendo CSV. Eliminar columnas de tipo string (opción B) no es una optimización general para el rendimiento de consultas, ya que el problema principal es el formato de almacenamiento. Configurar un clúster de Amazon EMR (opción D) es una solución potente, pero implica una mayor sobrecarga operativa en comparación con un trabajo de AWS Glue sin servidor para una tarea de conversión de formato.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta