Hai file CSV in Amazon S3 che includono una colonna timestamp formattata come: 1° marzo 2020, 08:14pm. Ipotizzi che il giorno della settimana, il mese e l'ora influenzino la variabile target, quindi devi aggiungere tre nuove feature (giorno della settimana, mese, ora) al dataset. Quale approccio aggiunge queste feature richiedendo il minor overhead operativo per produrre un nuovo file in S3?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Creare un nuovo flow in Amazon SageMaker Data Wrangler: importare il file S3, applicare la trasformazione Featurize date/time per generare le colonne del giorno della settimana, del mese e dell'ora, quindi esportare il dataset in S3..
Perché questa è la risposta
L'approccio con Amazon SageMaker Data Wrangler è il più efficiente in termini di overhead operativo. Data Wrangler è progettato per la preparazione dei dati senza codice o con codice minimo, offrendo trasformazioni predefinite come "Featurize date/time" che estraggono automaticamente giorno della settimana, mese e ora da una colonna timestamp. Questo elimina la necessità di scrivere codice complesso, ridurre i tempi di sviluppo e minimizzare la gestione dell'infrastruttura. Le altre opzioni, come Amazon EMR, SageMaker Processing Job e AWS Glue, richiedono tutte la scrittura e la manutenzione di codice (PySpark o Python) per implementare la logica di parsing e trasformazione, aumentando l'overhead operativo e di sviluppo. Sebbene siano soluzioni valide per la preparazione dei dati, non sono le più efficienti per questo specifico caso d'uso che può essere risolto con una trasformazione predefinita.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta