Ein ETL-Job muss täglich .csv-Dateien verarbeiten, die Benutzer in einen S3-Bucket legen. Jede Datei ist kleiner als 100 MB. Welche Implementierung ist die kostengünstigste?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Einen AWS Glue Python Shell-Job schreiben. Pandas verwenden, um die Daten zu transformieren..
Warum dies die Antwort ist
Die kostengünstigste Option ist ein AWS Glue Python Shell-Job mit Pandas. Da die Dateien klein sind (unter 100 MB) und täglich verarbeitet werden, ist ein Python Shell-Job ideal, da er für kleinere Workloads optimiert ist und nur für die Ausführungszeit der Skripte abgerechnet wird. Pandas ist eine effiziente Bibliothek für die Datenmanipulation in Python. Ein Amazon EKS-Cluster wäre für diesen Anwendungsfall überdimensioniert und teuer, da er für die Verwaltung komplexer Container-Workloads konzipiert ist. Amazon EMR ist ebenfalls zu teuer, da es für die Verarbeitung großer Datenmengen mit Frameworks wie Spark oder Hadoop gedacht ist, was für kleine Dateien unnötig ist. Ein AWS Glue PySpark-Job wäre zwar eine Option, aber Spark ist für die Verarbeitung großer, verteilter Datensätze optimiert und daher für kleine Dateien weniger kosteneffizient als ein Python Shell-Job.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich