Un trabajo semanal de Dataproc Spark se ejecuta durante ~30 minutos en un clúster de 15 nodos y escribe los resultados en BigQuery. ¿Cómo debería optimizar el costo del clúster dado este perfil?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar máquinas virtuales preemptible para el clúster de Dataproc..
Por qué esta es la respuesta
La opción correcta es usar máquinas virtuales preemptivas para el clúster de Dataproc. Las VMs preemptivas son significativamente más baratas que las VMs estándar y son adecuadas para cargas de trabajo tolerantes a fallos y de corta duración, como este trabajo semanal de 30 minutos. Aunque pueden ser detenidas por Google Cloud, el trabajo de Spark puede reanudarse o reintentarse, y el ahorro de costos es sustancial. Migrar a Cloud Dataflow podría ser una opción para optimizar costos, pero implica reescribir el código y no es una optimización directa del clúster de Dataproc existente. Usar nodos con mayor memoria o adjuntar SSD a los nodos de trabajo podría acelerar el trabajo, pero generalmente aumentaría el costo total del clúster, lo cual es contrario al objetivo de optimización de costos.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta