Firma przechowuje codzienne dane clickstream w szeregach czasowych w Amazon S3 (miliony wierszy dziennie). Inżynierowie ML codziennie uruchamiają raporty i analizują trzydniowe trendy za pomocą Amazon Athena. Dane muszą być przechowywane przez 30 dni przed archiwizacją. Który projekt zapewnia najwyższą wydajność pobierania danych?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Partycjonowanie obiektów szeregów czasowych w S3 według prefiksu daty i zastosowanie zasad S3 Lifecycle do archiwizacji partycji starszych niż 30 dni do S3 Glacier Flexible Retrieval..
Dlaczego to jest odpowiedź
Partycjonowanie danych w S3 według prefiksu daty (np. s3://bucket-name/year=YYYY/month=MM/day=DD/) jest kluczowe dla wydajności zapytań w Amazon Athena. Athena skanuje tylko dane w partycjach odpowiadających warunkom zapytania, co znacząco redukuje ilość skanowanych danych i koszty. Reguły S3 Lifecycle na partycjach pozwalają automatycznie przenosić starsze dane do S3 Glacier Flexible Retrieval po 30 dniach, optymalizując koszty przechowywania. Przechowywanie wszystkich danych bez partycji (opcja 1) lub w osobnych bucketach (opcja 4) jest nieefektywne dla zapytań Athena. Kopiowanie danych za pomocą Lambda (opcja 2) dodaje niepotrzebną złożoność i koszty operacyjne, podczas gdy reguły S3 Lifecycle są natywnym i efektywnym rozwiązaniem.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana