Потоковое задание Dataflow (Streaming Engine, горизонтальное автомасштабирование, max_workers=1000), считывающее уведомления Pub/Sub из GCS, выдает один элемент на каждую строку CSV. Задание использует только 10 воркеров, и автомасштабирование не добавляет новых. Как улучшить параллелизм и позволить автомасштабированию масштабироваться?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Изменить код конвейера, чтобы добавить шаг Reshuffle для разрыва слияния..
Почему это правильный ответ
Правильный ответ — изменить код конвейера, чтобы добавить шаг Reshuffle для разрыва слияния. Dataflow Streaming Engine автоматически масштабируется, но если источник данных (Pub/Sub, читающий из GCS) не распределяет данные равномерно или если в конвейере есть узкое место (например, слияние), это может препятствовать масштабированию. Reshuffle принудительно перераспределяет данные по воркерам, разрывая слияние и позволяя Dataflow лучше использовать доступные ресурсы и масштабироваться. Включение вертикального автомасштабирования (первый вариант) увеличит размер существующих ВМ, но не добавит новых воркеров, что не решит проблему недостаточного параллелизма. Увеличение максимального количества воркеров (третий вариант) не поможет, если Dataflow не видит необходимости в масштабировании из-за узкого места. Использование Dataflow Prime и Right Fitting (четвертый вариант) оптимизирует ресурсы, но не решает проблему слияния, препятствующего горизонтальному масштабированию.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется