Firma zbiera dane z wielu źródeł do zasobnika S3, uruchamia zadanie AWS Glue ETL w celu ich transformacji i przechowuje przetworzone dane wyjściowe w jeziorze danych opartym na S3, które jest odpytywane przez Amazon Athena. Firma musi identyfikować pasujące rekordy, nawet jeśli nie ma wspólnego unikalnego identyfikatora. Które rozwiązanie to umożliwi?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Wytrenuj i użyj transformacji AWS Lake Formation FindMatches w zadaniu ETL..
Dlaczego to jest odpowiedź
Transformacja AWS Lake Formation FindMatches jest przeznaczona do identyfikowania pasujących rekordów w zbiorach danych, nawet gdy brakuje wspólnego unikalnego identyfikatora. Wykorzystuje uczenie maszynowe do dopasowywania rekordów na podstawie podobieństwa danych, co jest kluczowe w scenariuszach, gdzie dane pochodzą z wielu źródeł i mogą zawierać niespójności lub brakujące identyfikatory. Można ją wytrenować w ramach zadania AWS Glue ETL, aby skutecznie czyścić i deduplikować dane przed ich zapisaniem w jeziorze danych. Pozostałe opcje są nieprawidłowe, ponieważ: Amazon Macie służy do wykrywania wrażliwych danych i nie jest narzędziem do dopasowywania rekordów. Klasa AWS Glue PySpark Filter służy do filtrowania danych na podstawie określonych kryteriów, a nie do identyfikowania pasujących rekordów bez unikalnego identyfikatora. Partycjonowanie tabel na podstawie unikalnego identyfikatora wymaga, aby taki identyfikator już istniał, co jest sprzeczne z wymaganiem pytania.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana