Kundendaten werden täglich in komprimierten, nach Datum partitionierten Dateien in S3 gespeichert. Analysten laden monatlich Ergebnisse herunter, validieren sie und laden sie in QuickSight hoch. Der Ingenieur muss die Datenqualität automatisch überprüfen, bevor sie an QuickSight gesendet werden, und das mit dem GERINGSTEN Betriebsaufwand. Welche Lösung passt am besten?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Jeden Monat einen AWS Glue Crawler ausführen, um den AWS Glue Data Catalog zu aktualisieren. AWS Glue Data Quality-Regeln verwenden, um die Datenqualität zu überprüfen..
Warum dies die Antwort ist
Die beste Lösung ist, monatlich einen AWS Glue Crawler auszuführen, um den Data Catalog zu aktualisieren, und dann AWS Glue Data Quality-Regeln zu verwenden. Dies bietet den geringsten Betriebsaufwand, da AWS Glue Data Quality eine verwaltete Funktion ist, die speziell für die Datenqualitätsprüfung entwickelt wurde und sich nahtlos in den Glue Data Catalog integriert. Die Option mit dem AWS Glue Trigger und PySpark erfordert die Entwicklung und Wartung benutzerdefinierter PySpark-Funktionen, was einen höheren Betriebsaufwand darstellt. Python-Skripte in Lambda für die Datenqualitätsbewertung sind ebenfalls wartungsintensiver, und die Konfiguration des S3-Buckets, um Lambda bei jedem Objekt-Upload aufzurufen, ist nicht ideal für eine monatliche Bewertung und würde bei täglichen Uploads unnötige Kosten verursachen. Die Verwendung von Amazon SQS und CloudWatch Insights ist für die Datenqualitätsbewertung ungeeignet, da CloudWatch Insights für Protokollanalysen und nicht für die Inhaltsprüfung von Daten in SQS-Nachrichten konzipiert ist.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich