Een ML-engineer moet een pipeline bouwen die Amazon Athena gebruikt voor twee workloads: grootschalige batch-transforms en modeltraining, en near-realtime queries met lage latency voor inferentie en analyses. Welk bestandsformaat zal de LAAGSTE latency opleveren voor zowel batch- als near-realtime verwerking?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Apache Parquet.
Waarom dit het antwoord is
Apache Parquet is een kolomgeoriënteerd bestandsformaat dat geoptimaliseerd is voor analytische queries, wat resulteert in lagere latency voor zowel batchverwerking als near-realtime queries. Het comprimeert gegevens efficiënt en maakt het mogelijk om alleen de benodigde kolommen te lezen, wat de I/O-kosten en querytijden aanzienlijk vermindert. CSV is een rijgeoriënteerd formaat zonder compressie of kolomselectie, wat leidt tot hogere latency. Nested JSON en Deserialized JSON zijn ook rijgeoriënteerd en minder efficiënt voor analytische workloads, vooral bij grote datasets, omdat ze meer gegevens moeten verwerken dan strikt noodzakelijk is voor kolomgebaseerde queries.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig