Un ingeniero de datos configuró un crawler de AWS Glue para catalogar datos en un bucket de S3 que contiene archivos .csv y .json. El crawler se configuró para excluir los archivos .json, pero al ejecutar consultas de Athena, los archivos .json aún se están procesando. El ingeniero debe solucionar esto sin cambiar el acceso a los archivos .csv y desea los tiempos de consulta más cortos posibles. ¿Cuál es la mejor solución?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Reubicar los archivos .json en una ruta diferente dentro del bucket de S3..
Por qué esta es la respuesta
La reubicación de los archivos .json en una ruta diferente dentro del bucket de S3 es la mejor solución porque el crawler de AWS Glue solo cataloga los metadatos de los archivos, no los elimina ni los oculta de Athena. Si los archivos .json permanecen en la misma ruta que los .csv, Athena los escaneará al consultar la tabla, incluso si no están catalogados, lo que aumenta los tiempos de consulta. Al mover los archivos .json, se asegura que Athena solo procese los datos relevantes para la tabla catalogada, optimizando el rendimiento. Ajustar la configuración del crawler de AWS Glue no resolverá el problema, ya que el crawler ya está configurado para excluir los .json; el problema es que Athena sigue viéndolos. Usar la consola de Athena para excluir archivos .json requeriría filtros en cada consulta, lo que es ineficiente y propenso a errores. Usar políticas de bucket de S3 para bloquear el acceso a los archivos .json afectaría el acceso a esos archivos para otros propósitos, lo cual no es el objetivo y podría causar problemas.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta