Ein Unternehmen verfügt über einen S3-Ordner, der gemischte Dateitypen (CSV, JSON, XLSX und Apache Parquet) enthält. Ein ML-Ingenieur wird AWS Glue DataBrew verwenden, um die Daten zu verarbeiten, und muss die endgültige Ausgabe wieder in S3 speichern, damit AWS Glue sie später konsumieren kann. Welcher Ansatz erfüllt diese Anforderungen?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Trennen Sie die Dateien nach Dateityp in separate Ordner, verarbeiten Sie jeden Ordner mit DataBrew und schreiben Sie die Ausgaben im Apache Parquet-Format..
Warum dies die Antwort ist
Die korrekte Antwort ist, die Dateien nach Dateityp in separate Ordner zu trennen, jeden Ordner mit DataBrew zu verarbeiten und die Ausgaben im Apache Parquet-Format zu speichern. AWS Glue DataBrew kann nur Daten aus einer einzelnen Quelle verarbeiten, die einen konsistenten Dateityp aufweist. Wenn der S3-Ordner gemischte Dateitypen enthält, muss DataBrew für jeden Dateityp separat konfiguriert werden. Durch das Trennen der Dateien in separate Ordner kann DataBrew effektiv auf jeden Dateityp angewendet werden. Das Speichern der Ausgabe im Apache Parquet-Format ist optimal, da es ein spaltenorientiertes Format ist, das für analytische Abfragen und die weitere Verarbeitung mit AWS Glue hochoptimiert ist. Die Option "AWS Glue Parquet-Format" ist irreführend, da es kein spezifisches "AWS Glue Parquet-Format" gibt; AWS Glue arbeitet mit dem Standard-Apache Parquet-Format. Die anderen Optionen sind falsch, da DataBrew keine gemischten Dateitypen in einem einzigen Job verarbeiten kann.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich