Задание Dataproc Spark с большим количеством операций shuffle считывает parquet-файлы размером ~200–400 МБ каждый и выполняется на вытесняемых (preemptible) рабочих узлах с использованием только двух невытесняемых узлов. Какое изменение следует внести для экономически эффективного повышения производительности?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Переключиться с HDD на SSD, переопределить конфигурацию вытесняемых VM для увеличения размера загрузочного диска..
Почему это правильный ответ
Правильный ответ — «Переключиться с HDD на SSD, переопределить конфигурацию вытесняемых VM для увеличения размера загрузочного диска». Задания Spark с большим количеством операций shuffle интенсивно используют дисковый ввод-вывод для записи промежуточных данных. Переход с HDD на SSD значительно ускорит эти операции, поскольку SSD имеют гораздо более высокую скорость произвольного чтения/записи. Увеличение размера загрузочного диска (который используется для хранения промежуточных данных shuffle) предотвратит нехватку места и улучшит производительность. Вариант с увеличением размера parquet-файлов неэффективен, так как большие файлы могут привести к проблемам с параллелизмом и не решают проблему интенсивного дискового ввода-вывода при shuffle. Переход на TFRecords не принесет значительного улучшения, так как проблема не в формате данных, а в операциях shuffle. Копирование данных в HDFS и обратно в GCS добавляет ненужные накладные расходы и не решает проблему медленного дискового ввода-вывода на рабочих узлах.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется