Necesita realizar un análisis exploratorio de datos (EDA) en un conjunto de datos a escala de petabytes, sin administrar la infraestructura del clúster, pagando solo por las consultas que ejecuta y escribiendo el análisis en Python desde un Jupyter notebook. ¿Qué solución satisface estas restricciones?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Ejecutar Apache Spark desde Amazon Athena..
Por qué esta es la respuesta
La opción correcta es ejecutar Apache Spark desde Amazon Athena. Athena permite el análisis interactivo de datos a escala de petabytes directamente desde Amazon S3, sin necesidad de administrar infraestructura. Recientemente, Athena añadió soporte para Apache Spark, lo que permite ejecutar análisis complejos en Python (PySpark) desde notebooks de Jupyter (a través de SageMaker Studio) y pagar solo por las consultas ejecutadas. Las otras opciones son incorrectas porque: Ejecutar Apache Spark desde Amazon SageMaker por sí solo no implica que se pague solo por las consultas; SageMaker Studio puede conectarse a Athena, pero la opción es incompleta. Ejecutar Apache Spark en un clúster de Amazon EMR requiere aprovisionar y administrar la infraestructura del clúster, lo cual contraviene el requisito de no administrar infraestructura. Usar Apache Spark integrado con Amazon Redshift implica administrar un clúster de Redshift y no se ajusta al modelo de pago por consulta para análisis exploratorio de datos en S3.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta