Un job Hadoop gourmand en E/S disque s'exécute beaucoup plus lentement sur Dataproc en utilisant Cloud Storage pour les intermédiaires que sur un HDFS bare-metal sur site. Comment résoudre ce problème tout en séparant le stockage et le calcul ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Provisionnez plus de disques persistants et conservez les données intermédiaires de ce job sur HDFS natif..
Pourquoi c'est la réponse
La bonne réponse est de provisionner plus de disques persistants et de conserver les données intermédiaires de ce job sur HDFS natif. Cloud Storage est optimisé pour le stockage à long terme et l'accès séquentiel, mais il peut être plus lent pour les opérations d'E/S aléatoires et intensives nécessaires aux données intermédiaires de Hadoop par rapport à un HDFS local. En utilisant des disques persistants locaux pour HDFS natif, on réduit la latence et augmente le débit pour les E/S intermédiaires, tout en maintenant la séparation du stockage et du calcul pour les données finales. Augmenter la mémoire ne résoudra pas le problème d'E/S disque si les données intermédiaires dépassent la RAM disponible. Augmenter les cœurs de CPU ou ajouter des cartes réseau n'améliorera pas significativement les performances d'E/S vers Cloud Storage pour des opérations intermédiaires intensives, car le goulot d'étranglement est la latence et le débit de Cloud Storage pour ce type de charge de travail.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise