Firma migruje starszą aplikację do jeziora danych opartego na S3. Starsze dane zawierają zduplikowane rekordy. Inżynier danych musi zidentyfikować i usunąć duplikaty przy NAJMNIEJSZYM nakładzie operacyjnym. Które rozwiązanie powinien wybrać inżynier?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Napisz zadanie ETL (extract, transform, and load) AWS Glue. Użyj transformacji uczenia maszynowego (ML) FindMatches, aby przetworzyć dane w celu deduplikacji..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to użycie zadania AWS Glue ETL z transformacją ML FindMatches. AWS Glue FindMatches jest zaprojektowane do identyfikowania i deduplikacji rekordów, nawet jeśli nie ma dokładnych dopasowań, co jest typowe dla starszych danych. Jest to rozwiązanie zarządzane, które minimalizuje nakład operacyjny, ponieważ AWS Glue zarządza infrastrukturą. Niestandardowe zadanie ETL w Pythonie z Pandas dropduplicates() wymagałoby dokładnych dopasowań i nie poradziłoby sobie z nieprecyzyjnymi duplikatami. Użycie biblioteki dedupe w Pythonie, niezależnie od tego, czy w niestandardowym zadaniu, czy w AWS Glue, wymagałoby większego nakładu pracy na konfigurację i zarządzanie zależnościami, zwiększając nakład operacyjny w porównaniu do wbudowanej funkcji Glue.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana