Een data-engineer moet gestructureerde .csv-bestanden (15 kolommen) laden in een Amazon S3 data lake. Analisten voeren Amazon Athena-query's uit die doorgaans slechts één of twee kolommen refereren en zelden het hele bestand scannen. Welke aanpak is het meest kosteneffectief?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Maak een AWS Glue extract, transform, and load (ETL)-taak om te lezen uit de .csv gestructureerde gegevensbron. Configureer de taak om de gegevens in Apache Parquet-formaat naar het data lake te schrijven..
Waarom dit het antwoord is
De meest kosteneffectieve aanpak is het gebruik van Apache Parquet. Parquet is een kolomgericht opslagformaat dat zeer efficiënt is voor analytische queries, vooral wanneer slechts een subset van kolommen wordt opgevraagd. Dit vermindert de hoeveelheid gescande data, wat direct leidt tot lagere kosten bij het gebruik van diensten zoals Amazon Athena (dat betaalt per gescande data). Een AWS Glue ETL-taak kan de CSV-bestanden lezen en converteren naar Parquet. Het opnemen van de gegevens in CSV-formaat (optie 1) behoudt de inefficiëntie van rijgeoriënteerde opslag, wat leidt tot hogere scankosten. JSON-formaat (optie 2) is ook rijgeoriënteerd en minder efficiënt voor analytische queries dan Parquet. Apache Avro (optie 3) is een rijgeoriënteerd formaat dat efficiënt is voor dataserialisatie, maar niet de kolomgerichte voordelen van Parquet biedt voor analytische workloads.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig