Een bedrijf heeft 10 TB aan data in een Amazon Redshift-cluster. Het data engineering-team gebruikt SageMaker Studio voor analyse en modelontwikkeling, maar slechts een subset van de Redshift-data is nodig voor training. Ze hebben een veilige, kosteneffectieve manier nodig om de relevante subset naar Amazon S3 te exporteren voor modelontwikkeling. Welke oplossingen voldoen aan deze vereisten? (Kies twee.)
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Sla Redshift-credentials op in AWS Secrets Manager. Haal vanuit een SageMaker Studio-notebook die credentials op en gebruik een Python-databaseadapter om de relevante data op te vragen en de resultaten te exporteren naar Amazon S3., Gebruik SageMaker Data Wrangler om de relevante Redshift-data op te vragen en te visualiseren en om de geselecteerde subset rechtstreeks naar Amazon S3 te exporteren..
Waarom dit het antwoord is
De optie om Redshift-credentials in AWS Secrets Manager op te slaan en vervolgens vanuit een SageMaker Studio-notebook een Python-databaseadapter te gebruiken om data op te vragen en te exporteren naar Amazon S3 is correct. Dit is een veilige en kosteneffectieve methode, omdat Secrets Manager veilige opslag van credentials biedt en een notebook de flexibiliteit heeft om alleen de benodigde subset op te vragen, waardoor onnodige dataoverdracht en opslagkosten worden vermeden. De optie om SageMaker Data Wrangler te gebruiken is ook correct. Data Wrangler is ontworpen voor data-voorbereiding en kan rechtstreeks verbinding maken met Redshift, data opvragen, visualiseren en de geselecteerde subset exporteren naar S3, wat het proces stroomlijnt en efficiënt maakt. De optie met een gedistribueerde SageMaker Processing-taak is minder kosteneffectief en complexer dan nodig voor alleen het opvragen en exporteren van een subset. Het starten van medium notebook instances met PySpark om 10 TB aan data te downloaden is onpraktisch en duur, aangezien notebooks niet bedoeld zijn voor het verwerken van zulke grote datasets in het geheugen. Een extra-large SageMaker notebook instance met 10 TB block storage is extreem duur en inefficiënt voor deze taak, omdat het de hele dataset zou downloaden in plaats van alleen de subset.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig