Inżynier ML musi przetwarzać tysiące istniejących plików CSV oraz nowe pliki CSV przesyłane do centralnego zasobnika S3. Wszystkie pliki CSV mają ten sam układ kolumn i zawierają kolumnę z datą transakcji, która musi być przeszukiwana. Które rozwiązanie zapewnia to z najmniejszym obciążeniem operacyjnym?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Uruchom Amazon Athena CREATE TABLE AS SELECT (CTAS), aby zbudować tabelę (partycjonowaną lub filtrowaną według daty transakcji) na danych S3, a następnie wykonaj zapytanie do tej tabeli..
Dlaczego to jest odpowiedź
Amazon Athena to bezserwerowa usługa zapytań, która umożliwia bezpośrednie analizowanie danych w S3 przy użyciu standardowego SQL. Użycie CREATE TABLE AS SELECT (CTAS) pozwala na utworzenie nowej tabeli (widoku) z danych S3, którą można partycjonować lub filtrować według daty transakcji, co znacznie optymalizuje wydajność zapytań i minimalizuje obciążenie operacyjne, ponieważ Athena automatycznie zarządza infrastrukturą. Pozostałe opcje są mniej optymalne: Replikacja do nowego zasobnika i S3 Object Lambda zwiększa złożoność i koszty zarządzania dwoma zasobnikami oraz wymaga dodatkowego kodu Lambda. Zadanie AWS Glue for Apache Spark jest potężne, ale generuje większe obciążenie operacyjne związane z zarządzaniem zadaniem Spark i jest overkill do prostego filtrowania. Kinesis Data Firehose z Lambda jest przeznaczone głównie do strumieniowego przesyłania danych w czasie rzeczywistym i nie jest najbardziej efektywnym rozwiązaniem do przetwarzania istniejących plików CSV i ad-hoc zapytań.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana