Инженер данных должен загрузить структурированные .csv-файлы (15 столбцов) в озеро данных Amazon S3. Аналитики выполняют запросы Amazon Athena, которые обычно ссылаются только на один или два столбца и редко сканируют весь файл. Какой подход является наиболее экономически эффективным?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Создать задание AWS Glue извлечения, преобразования и загрузки (ETL) для чтения из структурированного источника данных .csv. Настроить задание для записи данных в озеро данных в формате Apache Parquet..
Почему это правильный ответ
Наиболее экономически эффективным подходом является использование задания AWS Glue ETL для записи данных в озеро данных в формате Apache Parquet. Parquet — это колоночный формат хранения данных, который значительно повышает производительность запросов Athena, особенно когда аналитики запрашивают только подмножество столбцов. Athena сканирует только необходимые столбцы, что уменьшает объем сканируемых данных и, следовательно, снижает затраты. Использование CSV-формата (первый вариант) неэффективно, так как Athena пришлось бы сканировать весь файл для каждого запроса, даже если нужны только несколько столбцов. JSON (второй вариант) также является строковым форматом и не обеспечивает преимуществ колоночного хранения. Apache Avro (третий вариант) — это формат на основе строк, оптимизированный для сериализации и десериализации, но не для колоночных запросов, что делает его менее эффективным для данного сценария по сравнению с Parquet.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется