Un científico de datos entrena un modelo grande de PyTorch en SageMaker; cada trabajo de entrenamiento tarda unas 10 horas. Sospecha que el entrenamiento no está convergiendo y que la utilización de la GPU podría ser deficiente. ¿Qué enfoque requiere el menor esfuerzo de desarrollo para detectar y abordar estos problemas de entrenamiento?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar las reglas integradas de SageMaker Debugger, como vanishing_gradient y LowGPUUtilization, para detectar problemas y activar la acción StopTrainingJob..
Por qué esta es la respuesta
La opción correcta es usar las reglas integradas de SageMaker Debugger, como vanishinggradient y LowGPUUtilization, para detectar problemas y activar la acción StopTrainingJob. SageMaker Debugger está diseñado específicamente para monitorear y depurar trabajos de entrenamiento de SageMaker con un esfuerzo de desarrollo mínimo. Las reglas vanishinggradient y LowGPUUtilization abordan directamente las preocupaciones del científico de datos sobre la convergencia y la utilización de la GPU, respectivamente. Además, la acción StopTrainingJob detiene el trabajo automáticamente, ahorrando tiempo y recursos. Las otras opciones son menos eficientes: Monitorear la utilización de la CPU no es el enfoque principal para los problemas de GPU o convergencia en modelos de PyTorch. Publicar métricas personalizadas de alta resolución y usar una función Lambda requiere un esfuerzo de desarrollo considerable para configurar y mantener. Las reglas confusion y featureimportanceoverweight no son reglas integradas de SageMaker Debugger para detectar problemas de convergencia o baja utilización de GPU.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta