Un trabajo de Dataproc Spark con muchas operaciones de shuffle lee archivos Parquet de entre 200 y 400 MB cada uno y se ejecuta en workers preemptivos con solo dos nodos no preemptivos. Para mejorar el rendimiento de manera rentable, ¿qué cambio debería realizar?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Cambiar de HDD a SSD, anular la configuración de las VM preemptivas para aumentar el tamaño del disco de arranque..
Por qué esta es la respuesta
La opción correcta es cambiar de HDD a SSD y anular la configuración de las VM preemptivas para aumentar el tamaño del disco de arranque. Las operaciones de shuffle en Spark son intensivas en I/O. Los discos SSD ofrecen un rendimiento de lectura/escritura significativamente superior a los HDD, lo que aceleraría estas operaciones. Además, aumentar el tamaño del disco de arranque proporciona más espacio para el almacenamiento intermedio de shuffle, reduciendo la probabilidad de errores por falta de espacio y mejorando el rendimiento general. Las VM preemptivas son más económicas, pero su interrupción puede causar recomputaciones costosas, especialmente en trabajos con muchos shuffles. Aumentar el tamaño de los archivos Parquet a 1 GB podría ser contraproducente, ya que archivos muy grandes pueden dificultar la paralelización y el manejo de fallos. Cambiar a TFRecords no aborda el problema subyacente de I/O y el tamaño de 200 MB sigue siendo similar a Parquet, sin una mejora clara. Copiar datos a HDFS y usar SSDs solo para el almacenamiento local no es rentable, ya que GCS ya ofrece alta disponibilidad y rendimiento, y la sobrecarga de copiar datos anula los beneficios.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta