Firma posiada duży, nieustrukturyzowany zbiór danych zawierający wiele zduplikowanych rekordów w kluczowych atrybutach. Które rozwiązanie AWS zidentyfikuje duplikaty z najmniejszą ilością niestandardowego kodowania?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj transformacji AWS Glue FindMatches do identyfikacji zduplikowanych rekordów..
Dlaczego to jest odpowiedź
AWS Glue FindMatches to transformacja uczenia maszynowego zaprojektowana specjalnie do identyfikowania zduplikowanych lub pasujących rekordów w zbiorze danych, nawet jeśli nie ma dokładnych identyfikatorów. Działa poprzez uczenie się, które rekordy są takie same, na podstawie przykładów dostarczonych przez użytkownika, minimalizując potrzebę niestandardowego kodowania. Amazon Mechanical Turk wymaga ręcznego przeglądu, co jest czasochłonne i kosztowne dla dużych zbiorów danych. Amazon QuickSight ML Insights koncentruje się na analizie i wizualizacji danych, a nie na deduplikacji. Amazon SageMaker Data Wrangler to narzędzie do przygotowywania danych, ale FindMatches jest bardziej wyspecjalizowanym i efektywnym rozwiązaniem do deduplikacji.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana