Ein ML-Ingenieur muss eine Pipeline erstellen, die PII (persönlich identifizierbare Informationen) aus Petabytes unstrukturierter Daten erkennt und entfernt und die bereinigten Daten dann zum Trainieren von SageMaker-Modellen verwendet. Welche Lösung erfüllt diese Anforderung im großen Maßstab?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie die Apache Spark-basierte serverlose Engine in AWS Glue Interactive Sessions und wenden Sie die Detect PII-Transformation an, um PII zu finden und zu entfernen..
Warum dies die Antwort ist
Die Apache Spark-basierte serverlose Engine in AWS Glue Interactive Sessions mit der Detect PII-Transformation ist die effektivste Lösung. AWS Glue ist für die Verarbeitung großer Datenmengen (Petabytes) konzipiert und Spark bietet die nötige Skalierbarkeit. Die Detect PII-Transformation ist speziell für diesen Anwendungsfall optimiert. AWS Glue Data Wrangler ist eher für die interaktive Datenvorbereitung auf kleineren Datensätzen gedacht und SageMaker Canvas ist ein No-Code/Low-Code-Tool, das nicht für Petabyte-Skalierung ausgelegt ist. Die Amazon SageMaker Clarify API dient hauptsächlich der Fairness- und Bias-Erkennung und -Erklärung, nicht der PII-Entfernung. Die DetectEntities API von Amazon Comprehend ist zwar gut für die Erkennung von Entitäten, aber nicht für die skalierbare Entfernung von PII aus Petabytes unstrukturierter Daten optimiert und erfordert mehr kundenseitige Orchestrierung.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich