Firma dzieli swoje jezioro danych Amazon S3, używając ścieżek kluczy obiektów, takich jak s3://bucket/prefix/year=2023/month=01/day=01. AWS Glue Data Catalog musi pozostać zsynchronizowany z S3, gdy dodawane są nowe partycje. Które podejście zapewnia najniższe opóźnienie w utrzymywaniu aktualności katalogu?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj kodu, który zapisuje dane do Amazon S3, aby wywołać wywołanie API Boto3 AWS Glue create_partition..
Dlaczego to jest odpowiedź
Najniższe opóźnienie zapewnia bezpośrednie wywołanie API Boto3 AWS Glue createpartition z kodu, który zapisuje dane do S3. Dzięki temu partycje są dodawane do katalogu Glue natychmiast po utworzeniu nowych danych, zapewniając synchronizację w czasie rzeczywistym. Harmonogramowanie crawlera AWS Glue (opcja A) wprowadza opóźnienie, ponieważ crawler musi zostać uruchomiony i przeskanować S3. Ręczne uruchamianie API CreatePartition (opcja B) jest procesem manualnym i nie skaluje się, a także wprowadza opóźnienia. Uruchomienie MSCK REPAIR TABLE (opcja D) jest efektywne, ale podobnie jak crawler, wymaga uruchomienia i przeskanowania, co wiąże się z opóźnieniem.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana