Ein Dateningenieur hat einen AWS Glue Crawler konfiguriert, um Daten in einem S3-Bucket zu katalogisieren, der sowohl .csv- als auch .json-Dateien enthält. Der Crawler wurde so eingestellt, dass er die .json-Dateien ausschließt, aber beim Ausführen von Athena-Abfragen werden die .json-Dateien immer noch verarbeitet. Der Ingenieur muss dies beheben, ohne den Zugriff auf die .csv-Dateien zu ändern, und möchte die kürzestmöglichen Abfragezeiten. Was ist die beste Lösung?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verschieben Sie die .json-Dateien an einen anderen Pfad innerhalb des S3-Buckets..
Warum dies die Antwort ist
Das Verschieben der .json-Dateien in einen anderen S3-Pfad ist die beste Lösung, da AWS Glue Crawler Pfade und nicht Dateitypen ausschließt. Wenn der Crawler so konfiguriert ist, dass er einen bestimmten Pfad ausschließt, werden alle Dateien in diesem Pfad ignoriert. Durch das Verschieben der .json-Dateien in einen ausgeschlossenen Pfad werden sie nicht mehr katalogisiert und somit nicht von Athena verarbeitet, was die Abfragezeiten optimiert. Das Anpassen der Crawler-Einstellungen, um .json-Dateien auszuschließen, ist nicht direkt möglich, da Crawler auf Pfadebene arbeiten. Athena-Abfragen können zwar .json-Dateien ausschließen, aber dies würde die Abfragezeiten erhöhen, da Athena die Dateien immer noch scannen müsste. S3-Bucket-Richtlinien steuern den Zugriff, nicht die Katalogisierung oder Abfrageverarbeitung.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich