Vous avez reçu un jeu de données CSV dans S3 que vous utiliserez pour l'entraînement ML. Avant l'entraînement, vous devez trouver les valeurs manquantes ou invalides et compter les valeurs aberrantes avec le moins d'effort opérationnel. Quelle approche répond à cette exigence ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Conservez les données au format CSV, importez-les dans SageMaker Data Wrangler et utilisez le rapport de qualité des données et d'insights..
Pourquoi c'est la réponse
La bonne approche consiste à conserver les données au format CSV, à les importer dans SageMaker Data Wrangler et à utiliser le rapport de qualité des données et d'insights. SageMaker Data Wrangler est conçu pour la préparation et l'analyse des données, offrant des outils visuels et des rapports intégrés pour identifier les valeurs manquantes, invalides et les valeurs aberrantes avec un effort opérationnel minimal. Le rapport de qualité des données et d'insights fournit un aperçu rapide et complet de la distribution des données, des statistiques descriptives et des problèmes potentiels. Les autres options impliquent l'utilisation d'AWS Glue et d'Amazon Athena. Bien que ces services puissent être utilisés pour l'analyse de données, ils nécessitent plus d'efforts pour configurer des requêtes SQL spécifiques pour chaque type d'analyse (valeurs manquantes, invalides, aberrantes) et ne fournissent pas un rapport intégré et visuel comme Data Wrangler. La conversion en Parquet n'est pas nécessaire pour cette tâche spécifique d'analyse exploratoire et ajoute une étape inutile.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise