Een bedrijf slaat documenten op in Amazon S3, maar heeft geen vooraf gedefinieerde productcategorieën. Een data scientist moet een model bouwen om productcategorieën voor alle documenten af te leiden met maximale operationele efficiëntie. Welke oplossing is operationeel het meest efficiënt?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Train een SageMaker Neural Topic Model (NTM) om productcategorieën uit de documenten te ontdekken..
Waarom dit het antwoord is
De meest operationeel efficiënte oplossing is het trainen van een SageMaker Neural Topic Model (NTM). NTM is een unsupervised learning-algoritme dat specifiek is ontworpen voor het ontdekken van latente onderwerpen (productcategorieën) in een verzameling documenten zonder vooraf gedefinieerde labels. Dit sluit perfect aan bij de vereiste om productcategorieën af te leiden zonder dat deze vooraf bekend zijn. Het bouwen van een aangepast clusteringmodel via Dockerfiles en ECR is complexer en minder efficiënt, omdat SageMaker al ingebouwde, geoptimaliseerde algoritmen biedt voor dit soort taken. Het tokeniseren van documenten en trainen van een SageMaker k-means model is mogelijk, maar k-means is minder geschikt voor tekstuele data dan NTM, dat speciaal is ontworpen voor topic modeling. Een SageMaker BlazingText model is primair gericht op tekstclassificatie of word embeddings, niet op het ontdekken van onbekende categorieën in een ongestructureerde dataset.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig