Een online retailer slaat ALB-toegangslogs op in S3 en bevraagt deze met Amazon Athena. De engineer heeft een ongepartitioneerde Athena-tabel gemaakt en de responstijden van de query's zijn toegenomen naarmate het datavolume groeide. Welke aanpak zal de Athena-queryprestaties verbeteren met de minste operationele inspanning?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Maak een AWS Glue-crawler die een classifier gebruikt om het schema van alle ALB-toegangslogs te bepalen en partitiemetadata naar de AWS Glue Data Catalog schrijft..
Waarom dit het antwoord is
De correcte optie is het maken van een AWS Glue-crawler. Een crawler scant automatisch de S3-locatie van de ALB-toegangslogs, detecteert het schema en identificeert partities (bijvoorbeeld op basis van datum of tijdstempel in de bestandsstructuur). Deze partitiemetadata wordt vervolgens opgeslagen in de AWS Glue Data Catalog, die Athena gebruikt om query's uit te voeren. Door partities te gebruiken, kan Athena alleen de relevante subset van gegevens scannen, wat de queryprestaties aanzienlijk verbetert en de kosten verlaagt. Dit vereist minimale operationele inspanning omdat de crawler het proces automatiseert. De andere opties zijn minder efficiënt of complexer. Een AWS Glue-taak is meer geschikt voor ETL-transformaties en niet primair voor het afleiden van partities. Een Lambda-functie om logs naar Parquet te transformeren en partities toe te voegen, is een effectieve methode, maar vereist meer operationele inspanning voor ontwikkeling en onderhoud van de Lambda-functie. Apache Hive en bucketed tables zijn geen standaardoplossingen voor dit specifieke scenario en voegen onnodige complexiteit toe.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig