Инженер данных настроил AWS Glue crawler для каталогизации данных в бакете S3, который содержит файлы .csv и .json. Crawler был настроен на исключение файлов .json, но при выполнении запросов Athena файлы .json все еще обрабатываются. Инженер должен исправить это, не меняя доступ к файлам .csv, и хочет получить максимально короткое время выполнения запросов. Какое решение будет лучшим?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Переместить файлы .json в другой путь в бакете S3..
Почему это правильный ответ
Перемещение файлов .json в другой путь в бакете S3 является лучшим решением, потому что AWS Glue crawler каталогизирует данные на основе префиксов S3. Если файлы .json находятся в том же префиксе, что и .csv, crawler может их обнаружить, даже если настроен на исключение по расширению. Перемещение их в отдельный префикс гарантирует, что crawler не будет их сканировать, что напрямую решает проблему и оптимизирует время выполнения запросов Athena, так как Athena будет сканировать только релевантные данные. Настройка параметров crawler для исключения файлов .json уже была сделана, но не сработала. Использование консоли Athena для исключения файлов .json в запросах не решает проблему на уровне каталогизации и увеличивает время выполнения запросов, так как Athena все равно будет сканировать эти файлы. Использование политик бакета S3 для блокировки доступа к файлам .json не позволит Athena их читать, но это может повлиять на другие процессы, которым нужен доступ, и не решает проблему нежелательной каталогизации.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется