Интенсивная по дисковому вводу/выводу задача Hadoop выполняется на Dataproc с использованием Cloud Storage для промежуточных данных значительно медленнее, чем на локальном HDFS на "голом железе". Как это исправить, сохранив разделение хранилища и вычислений?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Выделите больше постоянного диска и храните промежуточные данные этой задачи в нативном HDFS.
Почему это правильный ответ
Проблема медленной работы задачи, интенсивно использующей дисковый ввод/вывод, при использовании Cloud Storage для промежуточных данных на Dataproc связана с накладными расходами на доступ к удаленному хранилищу. Cloud Storage, хотя и масштабируемый, имеет более высокую задержку по сравнению с локальным диском. Правильный ответ — "Выделите больше постоянного диска и храните промежуточные данные этой задачи в нативном HDFS". Это позволяет использовать локальное хранилище узлов Dataproc для промежуточных данных, что значительно снижает задержку и увеличивает пропускную способность ввода/вывода, сохраняя при этом разделение хранилища (Cloud Storage для исходных/конечных данных) и вычислений. Увеличение памяти (RAM) не решит проблему, если объем промежуточных данных превышает доступную RAM, и не является стандартным решением для дискового ввода/вывода. Увеличение ядер ЦП не влияет напрямую на производительность дискового ввода/вывода. Добавление сетевых карт не улучшит производительность, так как узким местом является задержка Cloud Storage, а не пропускная способность сети к нему.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется