Een data science-team zal veel verschillende trainingsdatasets opslaan en moet automatische schaling, kostenefficiëntie en SQL-gebaseerde exploratie ondersteunen. Welke opslagbenadering is het meest geschikt voor dit gebruiksscenario?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Datasets opslaan als bestanden in Amazon S3..
Waarom dit het antwoord is
Het opslaan van datasets als bestanden in Amazon S3 is de meest geschikte aanpak. S3 biedt automatische schaling, is zeer kostenefficiënt (pay-as-you-go) en ondersteunt SQL-gebaseerde exploratie via services zoals Amazon Athena, die direct query's uitvoeren op S3-data. Het opslaan van datasets op een Amazon EBS-volume gekoppeld aan een EC2-instantie is minder schaalbaar en kostenefficiënt, omdat de opslagcapaciteit en de kosten direct gekoppeld zijn aan de EC2-instantie. Het bewaren van datasets als tabellen in een multi-node Amazon Redshift-cluster is een optie voor datawarehousing, maar S3 is flexibeler en kostenefficiënter voor het opslaan van veel verschillende trainingsdatasets die mogelijk niet allemaal in een gestructureerd datawarehouse passen. Redshift is geoptimaliseerd voor gestructureerde data-analyse, niet primair voor de opslag van ruwe trainingsbestanden. Het opslaan van datasets als globale tabellen in Amazon DynamoDB is ongeschikt, omdat DynamoDB een NoSQL-database is die niet geoptimaliseerd is voor SQL-gebaseerde exploratie en meer geschikt is voor sleutel-waardeparen of documentdata met lage latentie.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig