Een data engineer extraheert maandelijks trainingsdata uit Amazon Redshift naar Amazon S3. Het bronschema omvat TransactionTimestamp (timestamp), CardName (varchar) en CardNo (varchar). De engineer moet (1) rijen verwijderen met CardNo = NULL, (2) TransactionTimestamp splitsen in TransactionDate en TransactionTime, en (3) CardName hernoemen naar NameOnCard. De oplossing moet de infrastructuursetup minimaliseren, maandelijks geautomatiseerd zijn en minimale belasting op het Redshift-cluster plaatsen. Welke oplossing voldoet aan deze vereisten?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Een AWS Glue-taak maken die het Amazon Redshift-cluster als bron en de S3-bucket als doel gebruikt. Gebruik Glue ingebouwde transformaties (Filter, Map, RenameField) om de vereiste wijzigingen toe te passen en de taak maandelijks te plannen..
Waarom dit het antwoord is
De AWS Glue-taak is de meest geschikte oplossing omdat deze serverloos is, waardoor de infrastructuursetup wordt geminimaliseerd. Glue biedt ingebouwde transformaties (Filter, Map, RenameField) die direct kunnen worden gebruikt om de vereiste datamanipulaties uit te voeren: rijen filteren, kolommen splitsen en hernoemen. Het kan eenvoudig maandelijks worden gepland en minimaliseert de belasting op Redshift door de extractie en transformatie efficiënt af te handelen. Andere opties zijn minder optimaal: Een Amazon EMR-cluster vereist het provisioneren en beheren van infrastructuur. Query's uitvoeren vanaf een EC2-instantie is een handmatig proces en niet geautomatiseerd. Redshift Spectrum is bedoeld voor het queryen van data in S3 vanuit Redshift, niet voor het exporteren van getransformeerde data van Redshift naar S3.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig