Компания ежедневно получает файл .xls размером около 2 ГБ в S3 с данными о клиентах. Инженер данных объединяет столбцы first-name и last-name и ему необходимо подсчитать количество уникальных клиентов в файле. Какой подход требует наименьших операционных усилий?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Использовать AWS Glue DataBrew для создания рецепта, который использует агрегатную функцию COUNT_DISTINCT для подсчета количества уникальных клиентов..
Почему это правильный ответ
AWS Glue DataBrew — это бессерверный сервис для визуальной подготовки данных, который позволяет выполнять преобразования без написания кода. Он предлагает встроенную функцию COUNTDISTINCT, что делает его наиболее простым решением с наименьшими операционными усилиями для данной задачи. Использование Apache Spark (в AWS Glue Notebook или Amazon EMR Serverless) требует написания кода и управления Spark-приложениями, что увеличивает операционные усилия. Хотя эти варианты мощны, они избыточны для такой простой задачи, как подсчет уникальных значений. AWS Glue Data Catalog с Amazon Athena — это хороший вариант для запросов к данным, но для подсчета уникальных значений в файле Excel сначала потребуется преобразовать его в поддерживаемый Athena формат (например, Parquet или CSV), что добавляет дополнительный шаг и операционные усилия по сравнению с DataBrew.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется