Firma inwestycyjna przetwarza stale rosnącą objętość danych półstrukturalnych i musi deduplikować rekordy, usuwając duplikaty i często występujące błędy pisowni. Która opcja zapewnia tę możliwość przy najmniejszym narzucie operacyjnym?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użycie funkcji FindMatches w AWS Glue do usuwania zduplikowanych rekordów..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to użycie funkcji FindMatches w AWS Glue do usuwania zduplikowanych rekordów. AWS Glue FindMatches to funkcja uczenia maszynowego, która identyfikuje zduplikowane rekordy, nawet jeśli nie ma dokładnych dopasowań, co jest idealne do danych półstrukturalnych z błędami pisowni. Minimalizuje narzut operacyjny, ponieważ jest to usługa zarządzana. Użycie funkcji innych niż Windows w Amazon Athena do usuwania zduplikowanych rekordów jest mniej efektywne, ponieważ Athena jest narzędziem do zapytań, a nie do deduplikacji opartej na uczeniu maszynowym, co nie radzi sobie z błędami pisowni. Amazon Neptune ML i skrypt Apache Gremlin są przeznaczone do grafowych baz danych i nie są odpowiednie do deduplikacji danych półstrukturalnych. Funkcje global tables w Amazon DynamoDB służą do replikacji danych między regionami i zapobiegania duplikacji na poziomie klucza podstawowego, a nie do identyfikacji i usuwania zduplikowanych rekordów z błędami pisowni.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana