Компания имеет 10–15 ТБ несжатых файлов .csv в Amazon S3 и планирует провести однократную оценку с использованием Amazon Athena. Компания хочет преобразовать данные, чтобы сократить время выполнения запросов и снизить затраты на хранение. Какой формат файла и выбор сжатия лучше всего удовлетворяет этим требованиям для запросов Athena?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Apache Parquet формат, сжатый с помощью Snappy.
Почему это правильный ответ
Apache Parquet — это колоночный формат хранения данных, который значительно сокращает объем сканируемых данных при запросах, что напрямую снижает затраты и ускоряет выполнение запросов в Athena. Сжатие Snappy обеспечивает хороший баланс между степенью сжатия и скоростью декомпрессии, что оптимально для аналитических рабочих нагрузок. .csv с zip: zip не является разделяемым форматом, что затрудняет параллельную обработку в Athena и снижает производительность. JSON с bzip2: JSON — это строковый формат, который менее эффективен для аналитических запросов, чем колоночные форматы. bzip2 обеспечивает высокую степень сжатия, но медленно декомпрессируется. Apache Avro с LZO: Avro — это строковый формат, который также менее эффективен для аналитических запросов, чем Parquet. LZO — это разделяемый формат, но Parquet с Snappy обычно превосходит его по производительности для запросов Athena.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется