Un ingegnere ML deve costruire una pipeline che scopra e rimuova le PII (Personally Identifiable Information) da petabyte di dati non strutturati, e quindi utilizzi i dati puliti per addestrare modelli SageMaker. Quale soluzione soddisfa questo requisito su larga scala?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare il motore serverless basato su Apache Spark nelle sessioni interattive di AWS Glue e applicare la trasformazione Detect PII per trovare e rimuovere le PII..
Perché questa è la risposta
La soluzione corretta è utilizzare il motore serverless basato su Apache Spark nelle sessioni interattive di AWS Glue e applicare la trasformazione Detect PII. AWS Glue offre un ambiente serverless e scalabile per l'elaborazione di grandi volumi di dati (petabyte) e la trasformazione "Detect PII" è specificamente progettata per identificare e rimuovere le informazioni personali da dati non strutturati. Le sessioni interattive di Glue consentono un'esplorazione e una trasformazione efficiente dei dati. Le altre opzioni non sono adatte per questa scala o scopo: AWS Glue Data Wrangler in Amazon SageMaker Canvas è più orientato alla preparazione dei dati per l'ML in un contesto di notebook, non per l'elaborazione di petabyte di dati non strutturati con una trasformazione PII specifica. Amazon SageMaker Clarify è utilizzato principalmente per la rilevazione di bias e la spiegabilità dei modelli, non per la rimozione di PII a livello di petabyte dai dati grezzi. L'API DetectEntities di Amazon Comprehend è un servizio NLP per l'estrazione di entità, ma non è progettato per la rimozione massiva e scalabile di PII da petabyte di dati non strutturati come una pipeline ETL.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta