Een ML-engineer moet duizenden bestaande CSV-bestanden plus nieuwe CSV-uploads verwerken die zijn opgeslagen in een centrale S3-bucket. Alle CSV's hebben dezelfde kolomindeling en bevatten een transactiedatumkolom die moet worden opgevraagd. Welke oplossing levert dit met de minste operationele overhead?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Voer een Amazon Athena CREATE TABLE AS SELECT (CTAS) uit om een tabel (gepartitioneerd of gefilterd op transactiedatum) te bouwen over de S3-gegevens en vraag vervolgens die tabel op..
Waarom dit het antwoord is
De correcte optie is het uitvoeren van een Amazon Athena CREATE TABLE AS SELECT (CTAS). Athena is een serverloze queryservice die S3-gegevens rechtstreeks kan bevragen met standaard SQL. Door een CTAS-query te gebruiken, kan een nieuwe tabel worden gemaakt die de gegevens partitioneert of filtert op transactiedatum, wat de queryprestaties aanzienlijk verbetert en de operationele overhead minimaliseert, aangezien er geen infrastructuur hoeft te worden beheerd. De andere opties zijn minder efficiënt of complexer: S3 Object Lambda is ontworpen voor het transformeren van objecten bij het ophalen, niet voor het efficiënt doorzoeken van grote datasets op basis van een kolomwaarde. Een AWS Glue for Apache Spark-taak zou een Spark-cluster moeten opstarten en beheren, wat meer operationele overhead met zich meebrengt dan Athena. Amazon Kinesis Data Firehose is bedoeld voor het streamen van gegevens en het voorbewerken ervan, niet voor het ad-hoc bevragen van bestaande bestanden. Het gebruik van een Lambda-functie om op transactiedatum te zoeken voor duizenden bestanden zou inefficiënt en kostbaar zijn.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig