Un job Dataflow ingérant des fichiers texte compressés avec gzip utilise des SideInputs pour joindre des données et écrit les erreurs dans une file d'attente de lettres mortes, mais le temps d'exécution du job est plus long que prévu. Quel changement accélère le pipeline ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utiliser CoGroupByKey au lieu de SideInput..
Pourquoi c'est la réponse
L'utilisation de CoGroupByKey au lieu de SideInput peut accélérer le pipeline car SideInput matérialise l'intégralité de la collection latérale en mémoire sur chaque worker, ce qui peut devenir un goulot d'étranglement pour de grands ensembles de données. CoGroupByKey, en revanche, est une transformation de jointure distribuée qui traite les données en parallèle et est plus efficace pour joindre de grandes collections. Convertir les fichiers en Avro compressé pourrait aider à la lecture, mais ne résout pas le problème de jointure. Réduire la taille du lot ne résoudrait pas le problème de performance de la jointure. Réessayer les enregistrements en erreur n'est pas lié à l'optimisation des performances de la jointure.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise