Компания хранит ежедневные данные временных рядов кликстрима в Amazon S3 (миллионы строк в день). Инженеры машинного обучения ежедневно запускают отчеты и анализируют трехдневные тренды с помощью Amazon Athena. Данные должны храниться 30 дней до архивации. Какой дизайн обеспечивает максимальную производительность извлечения данных?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Разделить объекты временных рядов в S3 по префиксу даты и применять политики S3 Lifecycle для архивации партиций старше 30 дней в S3 Glacier Flexible Retrieval..
Почему это правильный ответ
Правильный ответ — разделение объектов временных рядов в S3 по префиксу даты и применение политик S3 Lifecycle. Партиционирование данных по дате (например, s3://your-bucket/year=YYYY/month=MM/day=DD/) позволяет Athena сканировать только релевантные данные за последние три дня, значительно уменьшая объем сканирования и повышая производительность запросов. Политики S3 Lifecycle автоматически перемещают старые партиции в S3 Glacier Flexible Retrieval, оптимизируя затраты на хранение. Хранение всех данных без партиций (первый вариант) приведет к полному сканированию всего набора данных при каждом запросе, что крайне неэффективно. Использование AWS Lambda для копирования файлов (второй вариант) добавляет ненужную сложность и затраты, тогда как S3 Lifecycle может управлять этим автоматически. Хранение каждого дня в отдельном бакете (четвертый вариант) непрактично и усложняет управление, так как количество бакетов будет расти ежедневно.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется