Un científico de datos utilizará Amazon SageMaker Data Wrangler para ingerir datos históricos de S3 para el análisis exploratorio de datos (EDA) con el fin de encontrar anomalías poco comunes. Para minimizar los recursos de cómputo mientras realiza el EDA, ¿qué opción de importación debería elegir el científico de datos?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Importar los datos usando la opción First K, seleccionando K basándose en el conocimiento del dominio..
Por qué esta es la respuesta
Para minimizar los recursos de cómputo durante el EDA de anomalías poco comunes, la opción "First K" es la más adecuada. Esta opción permite importar las primeras K filas del conjunto de datos, lo que reduce significativamente la cantidad de datos procesados y, por ende, el uso de recursos. Al seleccionar un K apropiado basado en el conocimiento del dominio, el científico de datos puede asegurarse de que la muestra inicial sea lo suficientemente grande como para capturar posibles anomalías sin sobrecargar el sistema. Las otras opciones son menos eficientes: "None" importaría todo el conjunto de datos, lo que es ineficiente para conjuntos de datos grandes y para el objetivo de minimizar recursos. "Stratified" es útil para mantener la proporción de clases en el muestreo, pero no es la prioridad principal cuando el objetivo es minimizar recursos y buscar anomalías raras. "Randomized" importaría una muestra aleatoria, lo que podría no incluir las anomalías poco comunes si estas se encuentran en una parte específica del conjunto de datos.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta