Задание Dataflow, которое принимает сжатые текстовые файлы (gzipped text files), использует SideInputs для объединения данных и записывает ошибки в очередь недоставленных сообщений (dead-letter queue), но время выполнения задания дольше, чем ожидалось. Какое изменение ускорит конвейер?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Использовать CoGroupByKey вместо SideInput..
Почему это правильный ответ
Использование CoGroupByKey вместо SideInput ускорит конвейер, поскольку SideInput материализует все данные в памяти воркера, что может привести к неэффективности и замедлению при работе с большими наборами данных. CoGroupByKey, напротив, является распределенным преобразованием, которое обрабатывает данные параллельно, группируя их по ключу, что значительно эффективнее для больших объемов данных. Изменение входных файлов на сжатые Avro не решит проблему неэффективной обработки данных. Уменьшение размера пакета может снизить пропускную способность. Повторная обработка записей, вызвавших ошибку, не влияет на общую скорость выполнения конвейера.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется