Ein Unternehmen nutzt Amazon S3 als Data Lake und einen Multi-Node-Amazon-Redshift-Cluster als Data Warehouse. Die Datendateien im Lake sind nach ihrer Quelle organisiert, und das Unternehmen führt derzeit für jeden Dateispeicherort einen separaten COPY-Befehl aus, um die Daten in eine einzige Redshift-Tabelle zu laden, was langsam ist. Das Unternehmen muss die Datenaufnahme beschleunigen, ohne die Kosten zu erhöhen. Was sollte es tun?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Erstellen Sie eine Manifestdatei, die die Speicherorte der Datendateien enthält. Verwenden Sie einen COPY-Befehl, um die Daten in Amazon Redshift zu laden..
Warum dies die Antwort ist
Die Erstellung einer Manifestdatei, die alle S3-Dateispeicherorte enthält, ist die effizienteste Lösung. Der Amazon Redshift COPY-Befehl kann eine Manifestdatei verwenden, um mehrere Dateien gleichzeitig zu laden, was die Datenaufnahme erheblich beschleunigt, da Redshift die Daten parallel von allen angegebenen Speicherorten abrufen kann. Dies vermeidet die Notwendigkeit separater COPY-Befehle und nutzt die parallelen Verarbeitungsfähigkeiten von Redshift optimal aus, ohne zusätzliche Kosten zu verursachen. Ein bereitgestellter Amazon EMR-Cluster oder ein AWS Glue-Job zum Kopieren von Dateien würde zusätzliche Kosten verursachen und wäre nicht die direkteste Methode zur Beschleunigung des Ladevorgangs in Redshift. Das Laden in Amazon Aurora und ein anschließender AWS Glue-Job wäre ein unnötiger Zwischenschritt, der die Komplexität und die Kosten erhöht, anstatt die Aufnahme in Redshift zu optimieren.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich