Specjalista ds. danych użył modelu SageMaker Neural Topic Model (NTM) do rekomendowania tagów dla postów na blogu przechowywanych jako JSON w S3. Model sugeruje słowa-zapychacze (stopwords) takie jak „a”, „an” i „the”, a czasami rzadkie, ale prawidłowe słowa. Zespół chce zachować rzadkie słowa, ale upewnić się, że słowa-zapychacze nie są rekomendowane. Co powinien zrobić specjalista ds. danych?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Usunąć słowa-zapychacze z tekstu bloga za pomocą CountVectorizer z biblioteki scikit-learn i zastąpić dane w S3 zwektoryzowanymi wynikami..
Dlaczego to jest odpowiedź
Prawidłowa odpowiedź to usunięcie słów-zapychaczy z tekstu bloga za pomocą CountVectorizer z biblioteki scikit-learn i zastąpienie danych w S3 zwektoryzowanymi wynikami. CountVectorizer może być skonfigurowany do ignorowania słów-zapychaczy (stopwords) podczas tworzenia wektorów cech, co jest standardową techniką wstępnego przetwarzania tekstu. Pozwoli to zachować rzadkie, ale znaczące słowa, jednocześnie eliminując nieistotne słowa-zapychacze. Nieprawidłowe odpowiedzi: Amazon Comprehend służy do rozpoznawania encji, a nie do usuwania słów-zapychaczy. Algorytm PCA (Principal Component Analysis) jest techniką redukcji wymiarowości, a nie narzędziem do usuwania słów-zapychaczy z tekstu. Algorytm Object Detection służy do wykrywania obiektów na obrazach, a nie do przetwarzania tekstu.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana