Компания разбивает свое озеро данных Amazon S3 на разделы, используя пути ключей объектов, такие как s3://bucket/prefix/year=2023/month=01/day=01. Каталог данных AWS Glue должен оставаться синхронизированным с S3 при добавлении новых разделов. Какой подход обеспечивает наименьшую задержку для поддержания актуальности каталога?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Использовать код, который записывает данные в Amazon S3, для вызова API-запроса Boto3 AWS Glue create_partition..
Почему это правильный ответ
Использование кода, который записывает данные в Amazon S3, для вызова API-запроса Boto3 AWS Glue createpartition обеспечивает наименьшую задержку, так как разделы регистрируются в каталоге AWS Glue сразу после создания данных. Это гарантирует, что каталог всегда актуален. Запуск AWS Glue crawler каждое утро имеет задержку до 24 часов и может быть дорогостоящим для больших озер данных. Ручной запуск AWS Glue CreatePartition API дважды в день неэффективен и подвержен ошибкам. Запуск команды MSCK REPAIR TABLE из консоли AWS Glue также имеет задержку, поскольку она сканирует S3 для обнаружения новых разделов, что может быть медленным для больших наборов данных.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется