Ein Unternehmen speichert Trainingsdaten in verschachtelten JSON-Dateien in S3 und benötigt ein tabellarisches Format für das XGBoost-Training. Welcher Ansatz hat den geringsten operativen Aufwand, um diese JSON-Dateien in tabellarische Daten umzuwandeln?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Erstellen Sie einen AWS Glue PySpark-Job, der die Relationalize-Transformation verwendet, um die Dateien zu konvertieren..
Warum dies die Antwort ist
Die Erstellung eines AWS Glue PySpark-Jobs mit der Relationalize-Transformation ist die effizienteste Lösung. AWS Glue ist ein vollständig verwalteter ETL-Dienst, der speziell für die Datenverarbeitung in großem Maßstab entwickelt wurde. Die Relationalize-Transformation ist eine integrierte Funktion, die verschachtelte JSON-Daten automatisch in ein flaches, tabellarisches Format umwandelt, was den operativen Aufwand minimiert. Benutzerdefinierter Scala-Code mit EMR Serverless erfordert mehr Entwicklungs- und Wartungsaufwand. Eine AWS Lambda-Funktion mit Python und reduce() ist für große Datenmengen und komplexe Transformationen weniger geeignet und kann zu Timeout-Problemen führen. Amazon Athena ist ein Abfragedienst, keine ETL-Lösung, und die "Flatten"-Funktion ist nicht direkt für die Umwandlung komplex verschachtelter JSON-Strukturen in ein vollständig relationales Schema gedacht, sondern eher für das Entpacken von Arrays oder einfachen Strukturen.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich