Инженеру данных необходимо однократно прочитать объекты Apache Parquet в бакете S3 и извлечь только один столбец. Какой вариант позволяет достичь этого с минимальными операционными издержками?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Использовать S3 Select для написания SQL-запроса SELECT для извлечения требуемого столбца из объектов S3..
Почему это правильный ответ
S3 Select позволяет выполнять SQL-запросы непосредственно к данным, хранящимся в S3, без необходимости загружать весь объект. Это значительно снижает операционные издержки, так как вы платите только за данные, которые фактически извлекаются. Для файлов Parquet S3 Select может эффективно считывать только необходимые столбцы. Другие варианты менее эффективны: Использование AWS Lambda с pandas dataframe потребует загрузки всего объекта в память Lambda, что может быть дорого и медленно для больших файлов, а также ограничено по памяти. AWS Glue DataBrew — это инструмент для подготовки данных, который избыточен для простой задачи извлечения одного столбца и влечет за собой дополнительные затраты на запуск заданий. Запуск AWS Glue crawler и использование Amazon Athena — это подходящее решение для регулярных запросов к каталогизированным данным, но для однократного извлечения одного столбца из известных объектов это добавляет накладные расходы на создание каталога Glue и запуск Athena.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется