Al preparar datos de entrenamiento CSV para un algoritmo integrado de SageMaker, convertir el conjunto de datos a un numpy.array redujo la velocidad del entrenamiento. ¿Qué debe hacer para optimizar los datos de entrenamiento para los algoritmos integrados de SageMaker?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Convertir el conjunto de datos al formato RecordIO protobuf..
Por qué esta es la respuesta
Los algoritmos integrados de SageMaker están optimizados para consumir datos en el formato RecordIO protobuf. Este formato permite una lectura eficiente y paralela de los datos, lo que acelera significativamente el entrenamiento, especialmente con grandes conjuntos de datos. Convertir los datos a un numpy.array puede ser ineficiente para la E/S de disco y la transferencia de datos a los nodos de entrenamiento, lo que explica la reducción de la velocidad. La transformación por lotes de SageMaker se usa para inferencia, no para preparar datos de entrenamiento. AWS Glue puede comprimir datos, pero el formato Parquet no es el formato preferido para la entrada de algoritmos integrados de SageMaker. La optimización de hiperparámetros ajusta los parámetros del modelo, no el formato de los datos de entrenamiento.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta