Een bedrijf partitioneert zijn Amazon S3 data lake met behulp van object key paths zoals s3://bucket/prefix/year=2023/month=01/day=01. De AWS Glue Data Catalog moet gesynchroniseerd blijven met S3 wanneer nieuwe partities worden toegevoegd. Welke benadering biedt de laagste latentie om de catalogus up-to-date te houden?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik code die gegevens naar Amazon S3 schrijft om de Boto3 AWS Glue create_partition API-aanroep aan te roepen..
Waarom dit het antwoord is
De meest efficiënte benadering met de laagste latentie is het programmatisch aanroepen van de Boto3 AWS Glue createpartition API wanneer nieuwe gegevens naar S3 worden geschreven. Dit zorgt voor onmiddellijke synchronisatie van de Glue Data Catalog, wat cruciaal is voor real-time of near real-time analyse. Een AWS Glue crawler plannen om elke ochtend te draaien introduceert latentie, omdat nieuwe partities pas worden gedetecteerd bij de volgende geplande uitvoering. Het handmatig uitvoeren van de AWS Glue CreatePartition API tweemaal per dag is inefficiënt, foutgevoelig en introduceert ook aanzienlijke latentie. De MSCK REPAIR TABLE-opdracht (of ALTER TABLE RECOVER PARTITIONS in Athena) is een goede optie voor het herstellen van partities, maar het is een reactieve methode die handmatig of via een geplande taak moet worden uitgevoerd, wat opnieuw latentie introduceert en niet proactief is.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig