Firma przechowuje częściowo ustrukturyzowane dane transakcyjne w S3. Niektóre pliki są bardzo małe, podczas gdy inne mają dziesiątki terabajtów. Źródło wysyła pełny snapshot JSON raz dziennie, a także wysyła zmienione rekordy do jeziora danych. Inżynier danych musi wykonać przechwytywanie zmian danych (CDC), aby zidentyfikować zmiany w najbardziej opłacalny sposób. Które rozwiązanie jest NAJBARDZIEJ opłacalne?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj formatu jeziora danych open source, aby połączyć źródło danych z jeziorem danych S3 w celu wstawienia nowych danych i aktualizacji istniejących danych..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to użycie formatu jeziora danych open source, ponieważ formaty takie jak Apache Iceberg, Apache Hudi czy Delta Lake są zaprojektowane do efektywnego zarządzania danymi w S3, w tym do obsługi małych i dużych plików, oraz do wykonywania operacji CDC (insert, update, delete) bezpośrednio na danych w jeziorze danych. Pozwala to na śledzenie zmian bez konieczności przenoszenia danych do innej bazy danych. Pozostałe opcje są mniej opłacalne: Funkcja AWS Lambda do identyfikacji zmian byłaby kosztowna i skomplikowana w implementacji dla dużych zbiorów danych i różnorodnych rozmiarów plików. Ingestowanie danych do Amazon RDS for MySQL lub Amazon Aurora MySQL DB, a następnie użycie AWS DMS, wprowadza dodatkowe koszty związane z utrzymaniem bazy danych relacyjnej oraz opłatami za DMS, co jest niepotrzebne, gdy dane docelowe są w jeziorze danych S3.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana