Una empresa de redes sociales entrenará un modelo de clasificación de imágenes (utilizando el clasificador de imágenes integrado de SageMaker) para detectar contenido ofensivo. Utilizarán el modo pipe para acelerar el entrenamiento. El conjunto de datos se divide en carpetas de Training, Validation y Test, con subcarpetas de clases, imágenes redimensionadas uniformemente y dos archivos manifest llamados training.lst y validation.lst. Crearon buckets de S3 separados para las cargas de entrenamiento y validación. ¿Qué paso adicional de preparación de datos deberían realizar antes de subir a S3?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Convertir los manifests en archivos RecordIO (training.rec y validation.rec) usando la utilidad im2rec de Apache MXNet, luego subir los archivos RecordIO al bucket S3 de entrenamiento..
Por qué esta es la respuesta
Para usar el modo pipe con el clasificador de imágenes de SageMaker, los datos deben estar en formato RecordIO. La utilidad im2rec de Apache MXNet es la herramienta estándar para convertir un conjunto de datos de imágenes y sus archivos manifest (.lst) en archivos RecordIO (.rec). Estos archivos RecordIO se suben a S3 y SageMaker los consume directamente, lo que permite un entrenamiento eficiente en modo pipe. Las otras opciones son incorrectas: Pandas DataFrames y Parquet no son formatos compatibles para el modo pipe con el clasificador de imágenes de SageMaker. Comprimir los directorios con Snappy o gzip no convierte los datos al formato RecordIO requerido y no permite el modo pipe de manera eficiente para este algoritmo.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta