Sie müssen einen Datensatz in Amazon S3 mit Amazon Athena abfragen. Der Datensatz enthält über 800.000 CSV-Datensätze; jeder Datensatz ist etwa 1,5 MB groß und hat 200 Spalten, aber die meisten Abfragen greifen nur auf 5–10 Spalten zu. Welche Formatkonvertierung minimiert die Abfragelaufzeit?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Konvertieren Sie den Datensatz in das spaltenbasierte Apache Parquet-Format..
Warum dies die Antwort ist
Die Konvertierung in Apache Parquet minimiert die Abfragelaufzeit, da es sich um ein spaltenbasiertes Format handelt. Da die meisten Abfragen nur auf 5-10 der 200 Spalten zugreifen, muss Athena bei Parquet nur die relevanten Spalten lesen, was die Datenmenge reduziert und die Abfrageleistung erheblich verbessert. JSON und XML sind zeilenbasierte Formate, die das Lesen aller Spalten pro Zeile erfordern würden, selbst wenn nur wenige benötigt werden. GZIP-Komprimierung würde zwar die Speichergröße reduzieren, aber das CSV-Format bleibt zeilenbasiert, sodass Athena weiterhin alle Spalten lesen müsste, was die Abfrageleistung im Vergleich zu Parquet nicht so stark optimiert.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich