Uno scienziato dei dati utilizzerà Amazon SageMaker Data Wrangler per acquisire dati storici da S3 per l'analisi esplorativa dei dati (EDA) al fine di trovare anomalie rare. Per minimizzare le risorse di calcolo durante l'esecuzione dell'EDA, quale opzione di importazione dovrebbe scegliere lo scienziato dei dati?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Importare i dati utilizzando l'opzione First K, selezionando K in base alla conoscenza del dominio..
Perché questa è la risposta
Per minimizzare le risorse di calcolo durante l'EDA di anomalie rare, la scelta migliore è l'opzione "First K". Questa opzione consente di importare solo le prime K righe del dataset. Se le anomalie sono rare, è probabile che siano distribuite in modo non uniforme e che le prime K righe possano comunque contenere esempi significativi per l'analisi iniziale, riducendo drasticamente la quantità di dati da elaborare. La selezione di K basata sulla conoscenza del dominio permette di bilanciare la copertura dei dati con l'efficienza delle risorse. L'opzione "None" importerebbe l'intero dataset, consumando molte risorse. "Stratified" è utile per mantenere la proporzione delle classi ma non riduce significativamente le risorse se il dataset è grande. "Randomized" importerebbe un campione casuale, ma potrebbe non catturare le anomalie rare se la dimensione del campione è troppo piccola, o consumare troppe risorse se è troppo grande.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta