Een bedrijf heeft 10–15 TB aan ongecomprimeerde .csv-bestanden in Amazon S3 en is van plan een eenmalige evaluatie uit te voeren met Amazon Athena. Het bedrijf wil de gegevens transformeren om de querytijden te verkorten en de opslagkosten te verlagen. Welke bestandsindeling en compressie voldoen het beste aan deze vereisten voor Athena-query's?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Apache Parquet-indeling gecomprimeerd met Snappy.
Waarom dit het antwoord is
Apache Parquet gecomprimeerd met Snappy is de beste keuze. Parquet is een kolomgericht bestandsformaat, wat betekent dat Athena alleen de benodigde kolommen hoeft te lezen, wat de queryprestaties aanzienlijk verbetert en de hoeveelheid gescande data vermindert (en daarmee de kosten). Snappy is een snelle compressie-codec die een goede balans biedt tussen compressieverhouding en decompressiesnelheid, ideaal voor analytische workloads. De andere opties zijn minder geschikt: .csv gecomprimeerd met zip: CSV is een rij-georiënteerd formaat, wat minder efficiënt is voor analytische queries dan kolomgericht. Zip is ook minder efficiënt dan Snappy voor deze use case. JSON gecomprimeerd met bzip2: JSON is een tekstgebaseerd formaat, wat inefficiënt is voor grootschalige analyses. Bzip2 biedt hoge compressie, maar is langzamer bij decompressie, wat de querytijden kan verlengen. Apache Avro gecomprimeerd met LZO: Avro is een rij-georiënteerd formaat, wat minder optimaal is dan Parquet voor analytische queries. LZO is sneller dan bzip2, maar Parquet blijft superieur door zijn kolomgerichte aard.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig