Inżynier danych musi jednorazowo odczytać obiekty Apache Parquet w zasobniku S3 i wyodrębnić tylko jedną kolumnę. Która opcja pozwala to osiągnąć przy minimalnym nakładzie operacyjnym?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj S3 Select, aby napisać instrukcję SQL SELECT w celu pobrania wymaganej kolumny z obiektów S3..
Dlaczego to jest odpowiedź
S3 Select to najbardziej efektywne operacyjnie rozwiązanie, ponieważ umożliwia bezpośrednie wykonywanie zapytań SQL na danych w S3 bez konieczności ładowania całego obiektu. Pozwala to na pobranie tylko niezbędnej kolumny, minimalizując transfer danych i zużycie zasobów. Pozostałe opcje są mniej optymalne: Funkcja AWS Lambda z pandas wymagałaby załadowania całego obiektu do pamięci Lambdy, co jest nieefektywne dla dużych plików i generuje dodatkowe koszty obliczeniowe. AWS Glue DataBrew jest narzędziem do przygotowywania danych i transformacji, a nie do prostego, jednorazowego wyodrębniania pojedynczej kolumny. Wymagałoby to stworzenia projektu i przepływu pracy. Uruchomienie crawlera AWS Glue i użycie Amazon Athena jest dobrym rozwiązaniem dla regularnych zapytań i zarządzania metadanymi, ale dla jednorazowego odczytu jednej kolumny jest to nadmierny narzut operacyjny i czasowy na konfigurację crawlera i katalogu danych.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana