Un equipo de comercio electrónico entrena un modelo grande de clasificación de imágenes con 10 000 clases en muchas iteraciones de entrenamiento. Necesitan minimizar la sobrecarga operativa y el costo, evitando al mismo tiempo la pérdida de trabajo y el reentrenamiento. ¿Qué enfoque satisface mejor estas necesidades?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar el entrenamiento Spot administrado de SageMaker y habilitar el checkpointing al lanzar los trabajos de entrenamiento..
Por qué esta es la respuesta
La opción correcta es usar el entrenamiento Spot administrado de SageMaker con checkpointing. SageMaker Managed Spot Training permite usar instancias Spot de EC2 para reducir costos, gestionando automáticamente las interrupciones al guardar el estado del modelo (checkpointing) en S3. Esto asegura que el progreso del entrenamiento no se pierda y se pueda reanudar, minimizando la sobrecarga operativa y el reentrenamiento. Ejecutar trabajos de AWS Batch con instancias Spot requiere gestionar la lógica de interrupción y reanudación manualmente, aumentando la sobrecarga. Usar instancias Spot de EC2 y el aviso de interrupción implica implementar la lógica de guardado y reanudación, lo cual es propenso a errores y añade complejidad. AWS Lambda no es adecuado para entrenar modelos grandes debido a sus límites de tiempo de ejecución y memoria.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta