Amazon DEA-C01: Запросы к данным и аналитика — Руководство по подготовке

Часть Amazon Data Engineer Associate DEA-C01 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.

Этот раздел охватывает проектирование, настройку и эксплуатацию сервисов AWS, которые поддерживают аналитические запросы и BI для больших наборов данных. Основное внимание уделяется экономически эффективным, высокопроизводительным шаблонам запросов в Athena, Redshift, OpenSearch и QuickSight, а также их взаимодействию с S3, Glue и транзакционными хранилищами. Для освоения темы необходимо найти баланс между форматом хранения, партиционированием, типом вычислений и размещением данных, чтобы минимизировать количество сканируемых байт и сетевую асимметрию, обеспечивая при этом получение аналитических выводов с низкой задержкой.

Оптимизация запросов в Amazon Athena

Стоимость Athena зависит от количества отсканированных байт, поэтому физическая структура данных и метаданные являются основными рычагами управления. Используйте колоночные форматы (Parquet или ORC) со сжатием (Snappy для Parquet, опции Zlib/ORC) для уменьшения размера и нагрузки на CPU. Партиционируйте данные по столбцам с высокой кардинальностью, используемым для фильтрации в запросах (например, дата, регион), и регистрируйте партиции в Glue Data Catalog. Типичные шаблоны:

undefined

для заполнения партиций.

undefined

, чтобы принудительно использовать колоночное сжатие.

Когда запросы требуют объединения с транзакционными хранилищами, используйте Federated Query в Athena (коннекторы Lambda) для выполнения объединений между источниками, такими как RDS, DynamoDB или Redshift. Коннекторы развертываются как функции Lambda и регистрируются в качестве источников данных в Athena; пример действий в консоли: Athena > Data sources > Connectors > New. Критерии принятия решений:

Настройка запросов и распределения данных в Amazon Redshift

Производительность Redshift зависит от стиля распределения (distribution style) и ключей сортировки (sort keys), которые минимизируют перемещение данных и задействуют карты зон (zone maps). Выбирайте стили DIST, используя следующие критерии:

Определяйте SORTKEYs для столбцов, используемых в фильтрах по диапазону или в ORDER BY, чтобы задействовать карты зон и сократить количество чтений с диска. Распространенные операционные команды:

undefined

;

undefined

; отслеживайте метрики асимметрии (skew) и распределения в

undefined

и

undefined

. Redshift Spectrum позволяет запрашивать внешние таблицы S3 через Glue Data Catalog. Создайте внешнюю схему с помощью:

undefined

; Критерии выбора между Spectrum и нативным Redshift:

Amazon OpenSearch Service для анализа логов

OpenSearch оптимизирован для приема (ingest) и быстрого специального (ad-hoc) анализа логов; его конфигурация индекса и кластера определяет пропускную способность и стоимость. Проектирование и жизненный цикл индекса:

undefined

(для маленьких индексов: 1 шард; для больших: несколько шардов размером ~10–50 ГБ) и

undefined

для обеспечения доступности.

QuickSight для BI и визуализации

QuickSight предоставляет быстрые дашборды с двумя основными режимами получения данных: SPICE (in-memory) и прямой запрос (direct query). SPICE обеспечивает субсекундную производительность для дашбордов и подходит для повторяющихся чтений; прямые SQL-запросы (к Athena, Redshift, RDS) предпочтительны для очень больших или часто меняющихся наборов данных. Ключевые настройки и лучшие практики:

Распространенные ошибки и критерии выбора

Практическая задача: Пример использования

Компании Acme Retail требуются ежедневные BI-отчеты, объединяющие транзакционные заказы из Amazon RDS, события clickstream из S3 и профили пользователей из DynamoDB, с учетом ограничений по стоимости и с обновлением дашбордов по свежим данным менее чем за минуту.

  1. Преобразовать данные clickstream в S3 в партиционированный Parquet (на основе даты), сжать с помощью Snappy и зарегистрировать метаданные в AWS Glue с помощью crawler.
  2. Использовать Athena для ad-hoc запросов к S3 и развернуть коннекторы Federated Query для RDS и DynamoDB для выполнения соединений с небольшими таблицами-измерениями; материализовать результаты часто выполняемых соединений в формате Parquet, если запросы повторяются.
  3. Подготовить Redshift для тяжелых аналитических соединений: загрузить агрегированные срезы данных в Redshift, установить DISTKEY для столбца с высокой кардинальностью customer_id и определить SORTKEY по order_date; использовать Spectrum для доступа к «холодным» историческим данным в S3.
  4. Загружать логи приложений в OpenSearch с ежедневными шаблонами индексов; применять ILM для хранения свежих индексов на «горячих» узлах (hot nodes) и перемещения старых индексов в UltraWarm для экономии средств.
  5. Создать дашборды в QuickSight: импортировать свежие агрегированные данные в SPICE с запланированными инкрементальными обновлениями для достижения воспринимаемой скорости отклика менее минуты, и использовать прямые запросы (direct queries) для метрик, требующих постоянной свежести.

Обоснование: Такой подход минимизирует затраты на сканирование в Athena за счет партиционирования и колоночных форматов, уменьшает сетевой обмен (network shuffle) в Redshift благодаря правильным ключам распределения и сортировки, использует Spectrum, чтобы не хранить «холодные» данные в Redshift, применяет ILM в OpenSearch для оптимизации стоимости хранения и задействует SPICE для создания отзывчивых дашбордов, сохраняя при этом критическую свежесть данных с помощью прямых запросов.


Оркестрация данных и управление рабочими процессами · Все домены · Безопасность данных

Отработать эти вопросы → · Тесты на время на ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Сдайте экзамен →

Просмотреть Amazon →

Related guides

Все включено

Одна подписка. Каждый экзамен.

Каждый план открывает неограниченный поиск ответов, практические тесты, объяснения AI и полную библиотеку ресурсов — на более чем 20 языках.

Ежемесячно
24.87
Just €0.83/day
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

Лучшая цена
12 месяцев
179.87
Just €0.49/daySave 40%
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

✓ Включен бесплатный план · ✓ Отмена в любое время · ✓ Все планы открывают полный продукт