Un'azienda archivia i dati di training in file JSON annidati in S3 e necessita di un formato tabulare per il training di XGBoost. Quale approccio presenta il minor overhead operativo per convertire questi file JSON in dati tabulari?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Creare un job AWS Glue PySpark che utilizzi la trasformazione Relationalize per convertire i file..
Perché questa è la risposta
La creazione di un job AWS Glue PySpark con la trasformazione Relationalize è l'approccio con il minor overhead operativo. AWS Glue è un servizio ETL serverless che gestisce automaticamente il provisioning e la scalabilità delle risorse. La trasformazione Relationalize è specificamente progettata per convertire dati semi-strutturati e annidati (come JSON) in un formato tabulare, semplificando il processo senza richiedere codice complesso. Scrivere codice Scala personalizzato ed eseguirlo su Amazon EMR Serverless richiederebbe più sforzo di sviluppo e gestione, anche se EMR Serverless riduce l'overhead operativo rispetto a EMR tradizionale. Una funzione AWS Lambda con reduce() non è adatta per grandi volumi di dati o file di grandi dimensioni a causa dei limiti di esecuzione e memoria di Lambda. Creare un database Amazon Athena e usare la funzione flatten è un'opzione valida per l'interrogazione, ma non crea direttamente un output tabulare persistente e ottimizzato per il training di XGBoost senza passaggi aggiuntivi.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta