Amazon DEA-C01: Хранение данных и архитектура озера данных — Руководство по подготовке

Часть Amazon Data Engineer Associate DEA-C01 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.

Этот домен охватывает, как сервисы хранения и СУБД AWS поддерживают крупномасштабный прием данных, долговечное архивирование, производительность запросов и безопасное управление в современных платформах данных. Инженеры данных должны находить баланс между стоимостью, задержкой доступа, долговечностью и гранулярным контролем доступа при интеграции таких сервисов, как S3, Lake Formation, Redshift и DynamoDB, в конвейеры. Понимание компромиссов между классами хранения, автоматизации жизненного цикла, различий между управляемым и локальным хранилищем, а также шаблонов секционирования помогает избежать неожиданных проблем с производительностью и затратами в производственной среде.

Классы хранения и политики жизненного цикла Amazon S3

S3 предлагает несколько классов хранения и средств управления жизненным циклом для оптимизации затрат и шаблонов доступа. Класс хранения можно настроить при загрузке (в консоли или через CLI: aws s3 cp file s3://bucket/key –storage-class INTELLIGENT_TIERING) или с помощью правил жизненного цикла бакета (aws s3api put-bucket-lifecycle-configuration –bucket my-bucket –lifecycle-configuration file://lifecycle.json). Intelligent-Tiering автоматически перемещает объекты между уровнями для частого и редкого доступа и взимает небольшую плату за мониторинг; включайте его для неизвестных или меняющихся шаблонов доступа. Используйте правила жизненного цикла для перемещения объектов в GLACIER или DEEP_ARCHIVE для долгосрочного хранения, а также для удаления старых версий по истечении срока их действия.

Критерии принятия решений и компромиссы:

Примечания по эксплуатации:

Проектирование озера данных с помощью S3 и Lake Formation

Проектируйте озеро данных, используя S3 в качестве центрального объектного хранилища и Lake Formation для централизованного контроля доступа и каталогизации. Зарегистрируйте расположения S3 как ресурсы Lake Formation, настройте AWS Glue Data Catalog и используйте разрешения Lake Formation для баз данных/таблиц (aws lakeformation grant-permissions –principal arn:aws:iam::123456789012:user/analyst –permissions SELECT –resource ‘{…}’). Lake Formation может применять гранулярный контроль: на уровне столбцов, на уровне строк (с помощью выражений фильтрации) и маскирование на уровне ячеек, используя LF-теги и фильтры данных, применяемые к запросам Glue/Athena.

Ключевые шаблоны конфигурации и управления:

Критерии для принятия решений:

Архитектура и хранилище Amazon Redshift

Redshift разделяет вычислительные ресурсы и управляемое хранилище на узлах типа RA3 в противовес узлам DS2 с локальными SSD-дисками. Узлы RA3 используют Redshift Managed Storage (RMS), где данные хранятся в Amazon S3 под управлением кластера; выбирайте RA3 для масштабируемого хранилища со стабильной производительностью запросов и возможностью платить за вычисления отдельно. Узлы DS2 хранят данные на локальных дисках инстанса, что требует тщательного определения размера и его изменения по мере роста данных.

Детали конфигурации и эксплуатации:

Сравнение (RA3 и DS2):

DynamoDB и выбор специализированных баз данных

Выбирайте DynamoDB для высокомасштабируемых рабочих нагрузок типа «ключ-значение» и документных баз данных, требующих задержки в пределах нескольких миллисекунд. Проектирование таблицы зависит от выбора ключа раздела (и опционального ключа сортировки): используйте ключи с высокой кардинальностью и хорошим распределением, чтобы избежать «горячих» партиций. Для последовательных ключей или ключей на основе временных меток реализуйте случайные префиксы (шардирование) или используйте UUID для распределения операций записи. Используйте режим «по требованию» (on-demand), чтобы избежать выделения ресурсов, но рассмотрите подготовленную пропускную способность (provisioned capacity) с автомасштабированием для предсказуемых нагрузок и для использования адаптивной пропускной способности (adaptive capacity) на «горячих» партициях.

Примечания по практической настройке:

undefined

.

Критерии выбора движка:

Распространенные ошибки и критерии принятия решений

Практическая задача: Сценарий использования

Компания Acme Media должна хранить 50 ТБ необработанных видеоданных, предоставлять аналитикам доступ к преобразованным метаданным через запросы и обеспечивать доступ на уровне строк и столбцов для различных бизнес-подразделений, минимизируя при этом затраты на хранение.

  1. Загружать необработанное видео в S3 с помощью многочастной загрузки (multipart upload), тегировать объекты по дате загрузки и набору данных, использовать Intelligent-Tiering для начальных, неизвестных сценариев доступа.
  2. Настроить правила жизненного цикла для перемещения медиафайлов в GLACIER или DEEP_ARCHIVE по истечении настраиваемого периода хранения (убедитесь, что он соответствует 30+ дням, если рассматривается Standard-IA).
  3. Зарегистрировать расположения S3 в Lake Formation, создать краулеры Glue для заполнения Data Catalog и предоставить бизнес-подразделениям разрешения на уровне строк и столбцов на основе тегов Lake Formation.
  4. Хранить обработанные метаданные в Redshift RA3 для аналитики; прикрепить IAM-роль к кластеру для выполнения операций COPY из S3 и использовать операции VACUUM/ANALYZE в окнах обслуживания.
  5. Использовать DynamoDB с хэшированными ключами UUID для высокопроизводительной справочной таблицы манифестов видео и включить режим «по требованию» для поглощения всплесков трафика.

Обоснование: Такой подход изолирует затраты на холодное хранилище с помощью классов Glacier, использует Intelligent-Tiering для неизвестных сценариев доступа, применяет Lake Formation для безопасного, гранулярного контроля доступа в аналитических системах и выбирает RA3 для масштабируемого аналитического хранилища, в то время как DynamoDB обеспечивает операционные поиски с низкой задержкой.


Приём и сбор данных · Все домены · Каталогизация данных и управление метаданными

Отработать эти вопросы → · Тесты на время на ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Сдайте экзамен →

Просмотреть Amazon →

Related guides

Все включено

Одна подписка. Каждый экзамен.

Каждый план открывает неограниченный поиск ответов, практические тесты, объяснения AI и полную библиотеку ресурсов — на более чем 20 языках.

Ежемесячно
24.87
Just €0.83/day
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

Лучшая цена
12 месяцев
179.87
Just €0.49/daySave 40%
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

✓ Включен бесплатный план · ✓ Отмена в любое время · ✓ Все планы открывают полный продукт