Hai ricevuto un dataset CSV in S3 che utilizzerai per l'addestramento di ML. Prima dell'addestramento, devi trovare i valori mancanti o non validi e contare gli outlier con il minimo sforzo operativo. Quale approccio soddisfa questo requisito?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Mantenere i dati come CSV, importarli in SageMaker Data Wrangler e utilizzare il report Data Quality and Insights..
Perché questa è la risposta
L'opzione corretta sfrutta SageMaker Data Wrangler, che è specificamente progettato per la preparazione e l'analisi dei dati per il machine learning. Il suo report Data Quality and Insights fornisce automaticamente statistiche dettagliate su valori mancanti, non validi e outlier con il minimo sforzo operativo, direttamente dal CSV. Le opzioni che utilizzano AWS Glue e Athena richiedono la scrittura di query SQL per identificare e contare queste metriche, aumentando lo sforzo operativo rispetto a Data Wrangler. Sebbene la conversione in Parquet possa migliorare le prestazioni delle query, non offre l'analisi automatica e completa di Data Wrangler per la qualità dei dati. L'importazione in Data Wrangler dopo la conversione in Parquet è un passaggio aggiuntivo non necessario, poiché Data Wrangler gestisce direttamente i CSV.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta