Hai ricevuto un file Apache Parquet di 50 MB per un modello di rilevamento frodi che contiene diverse colonne correlate e non necessarie. Qual è il modo più semplice per rimuovere queste colonne dal file?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Crea un flusso di dati in SageMaker Data Wrangler e aggiungi un passaggio di trasformazione per eliminare le colonne non necessarie..
Perché questa è la risposta
SageMaker Data Wrangler è progettato per la preparazione dei dati e offre un'interfaccia utente grafica per creare flussi di dati che includono trasformazioni come l'eliminazione di colonne. Questo è il modo più semplice ed efficiente per gestire un file Parquet di 50 MB, poiché non richiede la scrittura di codice complesso o la gestione di infrastrutture Spark. Scaricare il file localmente e usare uno script Python sarebbe inefficiente per file più grandi e meno scalabile. Un job Apache Spark su Amazon EMR sarebbe eccessivo per un file di soli 50 MB e richiede più configurazione. Un job di elaborazione SageMaker con il SDK Python è un'opzione valida, ma Data Wrangler offre un approccio più rapido e visuale per questa specifica attività di pulizia dei dati.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta