Une entreprise stocke des données d'entraînement dans des fichiers JSON imbriqués dans S3 et a besoin d'un format tabulaire pour l'entraînement XGBoost. Quelle approche présente le moins de surcharge opérationnelle pour convertir ces fichiers JSON en données tabulaires ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Créer un job AWS Glue PySpark qui utilise la transformation Relationalize pour convertir les fichiers..
Pourquoi c'est la réponse
La création d'un job AWS Glue PySpark avec la transformation Relationalize est l'approche la moins coûteuse en termes de surcharge opérationnelle. AWS Glue est un service ETL sans serveur qui gère l'infrastructure sous-jacente, et Relationalize est spécifiquement conçue pour aplatir les données JSON imbriquées en un format tabulaire, ce qui est idéal pour XGBoost. Écrire du code Scala personnalisé avec EMR Serverless est une option viable mais implique plus de développement et de maintenance de code. Une fonction AWS Lambda n'est pas adaptée pour traiter de grands volumes de données en raison de ses limites de temps d'exécution et de mémoire, et reduce() n'est pas la méthode la plus efficace pour aplatir des JSON complexes. Amazon Athena permet d'interroger les données JSON, mais sa fonction flatten est plus adaptée pour des structures simples et ne fournit pas une transformation ETL complète et persistante comme Glue.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise