Un ingénieur ML doit créer un pipeline qui utilise Amazon Athena pour deux types de charges de travail : les transformations par lots à grande échelle et l'entraînement de modèles, ainsi que les requêtes à faible latence en quasi temps réel pour l'inférence et l'analyse. Quel format de fichier produira la latence la PLUS FAIBLE pour le traitement par lots et le traitement en quasi temps réel ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Apache Parquet.
Pourquoi c'est la réponse
Apache Parquet est un format de stockage de données en colonnes optimisé pour les charges de travail analytiques. Il offre une compression et un encodage efficaces, ce qui réduit considérablement la quantité de données à lire et à traiter, améliorant ainsi les performances pour les transformations par lots à grande échelle et les requêtes à faible latence. CSV est un format basé sur des lignes sans optimisation de compression ni de schéma, ce qui le rend moins efficace. Nested JSON et Deserialized JSON sont des formats basés sur des lignes, souvent plus volumineux et moins performants pour les requêtes analytiques en raison de leur structure et de l'absence d'optimisations de lecture en colonnes.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise