Una empresa tiene 10 TB de datos en un clúster de Amazon Redshift. El equipo de ingeniería de datos utiliza SageMaker Studio para el análisis y el desarrollo de modelos, pero solo se necesita un subconjunto de los datos de Redshift para el entrenamiento. Necesitan una forma segura y rentable de exportar el subconjunto relevante a Amazon S3 para el desarrollo de modelos. ¿Qué soluciones satisfacen estos requisitos? (Elija dos.)
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Almacenar las credenciales de Redshift en AWS Secrets Manager. Desde un notebook de SageMaker Studio, recuperar esas credenciales y usar un adaptador de base de datos de Python para consultar los datos relevantes y exportar los resultados a Amazon S3., Usar SageMaker Data Wrangler para consultar y visualizar los datos relevantes de Redshift y exportar el subconjunto seleccionado directamente a Amazon S3..
Por qué esta es la respuesta
La opción de almacenar las credenciales en AWS Secrets Manager y usar un adaptador de base de datos de Python desde un notebook de SageMaker Studio es correcta porque permite una conexión segura a Redshift y la exportación selectiva de datos a S3, cumpliendo con los requisitos de seguridad y costo-efectividad al procesar solo el subconjunto necesario. La opción de usar SageMaker Data Wrangler es también correcta, ya que está diseñado específicamente para la preparación de datos, incluyendo la conexión a Redshift, la selección de subconjuntos y la exportación directa a S3 de forma segura y eficiente. Las opciones incorrectas son: Ejecutar un trabajo distribuido de SageMaker Processing con Spark es una solución viable para grandes volúmenes, pero puede ser excesivo y más costoso si solo se necesita un subconjunto pequeño y la complejidad de Spark no es estrictamente necesaria para la consulta y exportación. Iniciar varias instancias de notebook medianas con PySpark y descargar los datos al clúster de notebooks es ineficiente y costoso, ya que implica mover 10 TB de datos a las instancias de notebook, lo cual no es escalable ni rentable para solo un subconjunto. Lanzar una instancia de notebook extra grande con almacenamiento de 10 TB para descargar todos los datos es extremadamente costoso y poco práctico. El objetivo es exportar un subconjunto, no todos los datos.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta