Ein ML-Ingenieur muss wöchentlich Daten aus zwei Quellen zusammenführen und transformieren: große CSV-Dateien in S3 (jede mit Millionen von Zeilen) und einen Amazon Aurora-Cluster. Die zusammengeführte Ausgabe muss in einen anderen S3-Bucket geschrieben werden. Welche Option bietet dies mit dem geringsten Betriebsaufwand?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Einen wöchentlichen AWS Glue-Job mit der Apache Spark-Engine planen und DynamicFrame-Operationen verwenden, um die Daten zusammenzuführen und zu transformieren..
Warum dies die Antwort ist
Die Planung eines wöchentlichen AWS Glue-Jobs mit der Apache Spark-Engine ist die beste Option für minimalen Betriebsaufwand. AWS Glue ist ein vollständig verwalteter ETL-Service, der serverlos ist und sich automatisch skaliert, was den Betriebsaufwand erheblich reduziert. Die Verwendung von DynamicFrames vereinfacht die Datenverarbeitung. Das Bereitstellen eines temporären Amazon EMR-Clusters erfordert mehr Konfiguration und Verwaltung. Eine AWS Lambda-Funktion ist für die Ausführung von Apache Spark-Code ungeeignet, da Lambda für kurzlebige, ereignisgesteuerte Funktionen konzipiert ist und Spark-Jobs in der Regel mehr Ressourcen und längere Laufzeiten benötigen. AWS Batch erfordert die Verwaltung von EC2-Instanzen und die Konfiguration der Spark-Umgebung, was den Betriebsaufwand erhöht.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich