Vous recevez un fichier Apache Parquet de 50 Mo pour un modèle de détection de fraude, qui contient plusieurs colonnes corrélées et inutiles. Quelle est la méthode la moins coûteuse en effort pour supprimer ces colonnes du fichier ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Créez un flux de données dans SageMaker Data Wrangler et ajoutez une étape de transformation pour supprimer les colonnes inutiles..
Pourquoi c'est la réponse
La création d'un flux de données dans SageMaker Data Wrangler avec une étape de transformation est la méthode la moins coûteuse en effort. Data Wrangler offre une interface visuelle pour la préparation des données, permettant de sélectionner et de supprimer facilement des colonnes sans écrire de code complexe. Les autres options impliquent plus d'effort de développement. Télécharger le fichier localement et utiliser un script Python nécessite du codage manuel et n'est pas optimisé pour des fichiers potentiellement plus grands. Un job Apache Spark sur Amazon EMR est puissant mais surdimensionné et plus complexe pour une simple suppression de colonnes. Un job de traitement SageMaker avec le SDK Python est également une solution par programmation qui demande plus de développement qu'une interface visuelle.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise