Een data engineer heeft een AWS Glue crawler geconfigureerd om data te catalogiseren in een S3 bucket die zowel .csv- als .json-bestanden bevat. De crawler was ingesteld om de .json-bestanden uit te sluiten, maar bij het uitvoeren van Athena-queries worden de .json-bestanden nog steeds verwerkt. De engineer moet dit oplossen zonder de toegang tot de .csv-bestanden te wijzigen en wil de kortst mogelijke querytijden. Wat is de beste oplossing?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Verplaats de .json-bestanden naar een ander pad binnen de S3 bucket..
Waarom dit het antwoord is
Het verplaatsen van de .json-bestanden naar een ander pad binnen de S3 bucket is de beste oplossing omdat dit ervoor zorgt dat de AWS Glue crawler deze bestanden niet meer tegenkomt en dus ook niet catalogiseert, zelfs als de uitsluitingsregel niet perfect werkt. Dit voorkomt dat Athena de .json-bestanden verwerkt, wat de querytijden verkort en de toegang tot de .csv-bestanden ongemoeid laat. Het aanpassen van de AWS Glue crawler-instellingen is een logische stap, maar de vraag impliceert dat dit al is geprobeerd ("De crawler was ingesteld om de .json-bestanden uit te sluiten") en niet effectief was. Het gebruik van de Athena-console om bestanden uit te sluiten zou betekenen dat de .json-bestanden nog steeds worden gecatalogiseerd en Athena extra werk moet doen om ze te filteren, wat de querytijden niet optimaliseert. S3 bucket policies blokkeren de toegang, maar de bestanden zouden nog steeds gecatalogiseerd kunnen zijn, en het is een te ingrijpende maatregel voor dit specifieke probleem.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig