Musisz połączyć dwa zbiory danych – zamówienia klientów i opisy katalogów produktów – które mają różne struktury i formaty, dopasowując podobne rekordy i usuwając duplikaty. Które rozwiązanie jest najbardziej odpowiednie do dopasowywania i czyszczenia tych danych?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Uruchom crawlery AWS Glue, aby wypełnić Glue Data Catalog i użyj transformacji Glue FindMatches do identyfikacji podobnych rekordów i deduplikacji danych..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to użycie AWS Glue z transformacją FindMatches. AWS Glue FindMatches to usługa uczenia maszynowego, która identyfikuje zduplikowane lub pasujące rekordy w zbiorach danych, nawet jeśli nie ma wspólnych identyfikatorów ani identycznych wartości, co jest idealne dla danych o różnych strukturach i formatach. Crawlery AWS Glue są niezbędne do skatalogowania danych w Glue Data Catalog, co jest warunkiem wstępnym dla FindMatches. Napisanie funkcji AWS Lambda do porównywania pól jest zbyt pracochłonne i mniej efektywne w przypadku złożonego dopasowywania rozmytego. Interfejs API Glue SearchTables służy do wyszukiwania metadanych tabel, a nie do dopasowywania danych. Lake Formation koncentruje się na zarządzaniu uprawnieniami i bezpieczeństwie danych, a nie na transformacjach dopasowujących dane.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana