Een bedrijf uploadt CSV-bestanden naar een Amazon S3-bucket. Een AWS Glue crawler bouwt tabellen en schema's voor de data, en een AWS Glue job verwerkt de tabellen en schrijft de resultaten naar een Amazon Redshift-database. De Glue job regelt de kolommapping en maakt de Redshift-tabellen aan indien nodig. Het opnieuw uitvoeren van de Glue job zorgt ervoor dat dubbele rijen verschijnen in de Redshift-tabellen. Het bedrijf heeft een manier nodig om de Redshift-tabellen bij te werken zonder duplicaten te introduceren. Welke aanpak voldoet aan deze vereiste?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Wijzig de AWS Glue job om de rijen naar een staging Redshift-tabel te kopiëren. Voeg SQL-commando's toe om de bestaande rijen bij te werken met nieuwe waarden uit de staging Redshift-tabel..
Waarom dit het antwoord is
De correcte aanpak is om een stagingtabel te gebruiken in Redshift. De Glue job schrijft de nieuwe data eerst naar deze tijdelijke tabel. Vervolgens kunnen SQL-commando's, zoals UPDATE en INSERT (of een MERGE statement indien beschikbaar in de specifieke Redshift-versie), worden gebruikt om de hoofdtabel bij te werken met de data uit de stagingtabel. Dit zorgt ervoor dat bestaande rijen worden bijgewerkt en nieuwe rijen worden toegevoegd zonder duplicaten te creëren. De andere opties zijn minder geschikt: MySQL gebruiken introduceert onnodige complexiteit en extra kosten. dropDuplicates() verwijdert alleen duplicaten binnen de huidige dataset, niet ten opzichte van reeds bestaande data in Redshift. ResolveChoice is voor het oplossen van schema-inconsistenties in Glue DataFrames, niet voor het beheren van duplicaten in een doeltabel.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig