Una empresa almacena datos de entrenamiento en archivos JSON anidados en S3 y necesita un formato tabular para el entrenamiento de XGBoost. ¿Qué enfoque tiene la menor sobrecarga operativa para convertir esos archivos JSON a datos tabulares?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Crear un trabajo de AWS Glue PySpark que utilice la transformación Relationalize para convertir los archivos..
Por qué esta es la respuesta
La transformación Relationalize de AWS Glue PySpark está diseñada específicamente para aplanar datos semiestructurados, como JSON anidado, en un formato tabular. Esto es ideal para el entrenamiento de XGBoost. Al ser un servicio sin servidor, AWS Glue minimiza la sobrecarga operativa. Escribir código Scala personalizado en EMR Serverless introduce más complejidad de desarrollo y gestión. Una función Lambda con reduce() sería ineficiente y costosa para grandes volúmenes de datos. Aunque Athena puede consultar JSON, su función flatten es más para desanidar arrays simples y no tan robusta como Relationalize para estructuras JSON complejas, además de que Athena es principalmente para consultas, no para transformaciones persistentes de datos.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta