Компания имеет папку S3, которая содержит файлы смешанных типов (CSV, JSON, XLSX и Apache Parquet). Инженер машинного обучения будет использовать AWS Glue DataBrew для обработки данных и должен сохранить окончательный результат обратно в S3, чтобы AWS Glue мог использовать его позже. Какой подход удовлетворяет этим требованиям?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Разделить файлы на отдельные папки по типу файла, обработать каждую папку с помощью DataBrew и записать результаты в формате Apache Parquet..
Почему это правильный ответ
Правильный ответ — разделить файлы на отдельные папки по типу файла, обработать каждую папку с помощью DataBrew и записать результаты в формате Apache Parquet. AWS Glue DataBrew лучше всего работает с однородными источниками данных. Разделение файлов по типу (CSV, JSON, XLSX, Parquet) позволяет DataBrew эффективно обрабатывать каждый набор данных с соответствующими преобразованиями. Сохранение результатов в формате Apache Parquet является оптимальным, поскольку это столбцовый формат, который обеспечивает высокую производительность при запросах и анализе данных, что идеально подходит для последующего использования AWS Glue. Неправильные варианты: Использование DataBrew для обработки существующей папки S3 без разделения по типу файла может привести к ошибкам или неэффективной обработке из-за разнородности данных. Формат AWS Glue Parquet не является стандартным форматом; AWS Glue использует стандартный Apache Parquet.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется