Un job Dataproc Spark avec de nombreux shuffles lit des fichiers Parquet d'environ 200 à 400 Mo chacun et s'exécute sur des workers préemptibles avec seulement deux nœuds non préemptibles. Pour améliorer les performances de manière rentable, quelle modification devriez-vous apporter ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Passer des HDD aux SSD, remplacer la configuration des VM préemptibles pour augmenter la taille du disque de démarrage..
Pourquoi c'est la réponse
La bonne réponse est de passer des HDD aux SSD et d'augmenter la taille du disque de démarrage des VM préemptibles. Les opérations de shuffle Spark sont intensives en I/O. Les SSD offrent des performances d'I/O bien supérieures aux HDD, ce qui réduit considérablement les temps d'accès aux données temporaires écrites pendant les shuffles. Augmenter la taille du disque de démarrage fournit plus d'espace pour ces données temporaires, évitant ainsi les goulots d'étranglement liés à l'espace disque. Augmenter la taille des fichiers Parquet à 1 Go pourrait aider à réduire le nombre de tâches et l'overhead, mais ne résoudrait pas le problème fondamental des I/O intenses des shuffles. Passer aux TFRecords n'est pas une amélioration directe pour les shuffles par rapport à Parquet, et le format n'est pas le problème principal ici. Copier les données vers HDFS sur des SSD puis vers GCS ajoute une complexité et un coût inutiles, car Dataproc est conçu pour fonctionner efficacement avec GCS.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise