Ein Unternehmen partitioniert seinen Amazon S3 Data Lake mithilfe von Objektschlüsselpfaden wie s3://bucket/prefix/year=2023/month=01/day=01. Der AWS Glue Data Catalog muss mit S3 synchronisiert bleiben, wenn neue Partitionen hinzugefügt werden. Welcher Ansatz bietet die geringste Latenz, um den Katalog auf dem neuesten Stand zu halten?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie Code, der Daten in Amazon S3 schreibt, um den Boto3 AWS Glue create_partition API-Aufruf aufzurufen..
Warum dies die Antwort ist
Die Verwendung von Code, der die Boto3 AWS Glue createpartition API aufruft, wenn neue Daten in S3 geschrieben werden, bietet die geringste Latenz. Dies stellt sicher, dass der Glue Data Catalog sofort aktualisiert wird, sobald neue Partitionen verfügbar sind. Das Planen eines Crawlers, selbst täglich, führt zu einer Latenz von bis zu 24 Stunden. Das manuelle Ausführen der CreatePartition API ist ineffizient und fehleranfällig. MSCK REPAIR TABLE ist ein Athena-Befehl, der den Katalog aktualisiert, aber er muss manuell oder über ein Skript ausgeführt werden und bietet keine geringere Latenz als die direkte API-Integration in den Schreibprozess.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich