Een bedrijf slaat semi-gestructureerde transactionele data op in S3. Sommige bestanden zijn klein, terwijl andere tientallen terabytes groot zijn. De bron stuurt dagelijks een volledige JSON-snapshot en stuurt ook gewijzigde records naar het data lake. Een data engineer moet Change Data Capture (CDC) uitvoeren om wijzigingen zo kostenefficiënt mogelijk te identificeren. Welke oplossing is het MEEST kostenefficiënt?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik een open source data lake-formaat om de databron samen te voegen met het S3 data lake om de nieuwe data in te voegen en de bestaande data bij te werken..
Waarom dit het antwoord is
Een open source data lake-formaat zoals Apache Iceberg, Apache Hudi of Delta Lake biedt ingebouwde functionaliteit voor Change Data Capture (CDC) en ACID-transacties op S3. Dit maakt het mogelijk om efficiënt nieuwe records in te voegen, bestaande records bij te werken en te verwijderen, wat essentieel is voor het verwerken van dagelijkse snapshots en gewijzigde records. Deze formaten zijn ontworpen voor grootschalige data lakes en bieden kosteneffectieve oplossingen door geoptimaliseerde lees- en schrijfbewerkingen. Het gebruik van een Lambda-functie voor het vergelijken van grote datasets is inefficiënt en duur, vooral met terabytes aan data. Het importeren van data in Amazon RDS of Aurora en vervolgens AWS DMS gebruiken, introduceert onnodige complexiteit en kosten voor het beheren van relationele databases, terwijl de data al in S3 staat.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig