У вас есть локальные задания Spark, ежедневно обрабатывающие Parquet. При миграции в Google Cloud вам нужны управляемые сервисы, минимальные изменения ETL и доступность BigQuery для будущих конвейеров. Что вам следует сделать?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Перенести данные в Cloud Storage и перенести метаданные в Dataproc Metastore (DPMS). Переработать задания Spark для чтения/записи в Cloud Storage и запустить их на Dataproc Serverless..
Почему это правильный ответ
Правильный вариант предлагает оптимальное решение. Перенос данных в Cloud Storage обеспечивает масштабируемое и экономичное хранилище для файлов Parquet. Dataproc Metastore (DPMS) предоставляет управляемый каталог метаданных, совместимый с Hive Metastore, что минимизирует изменения в существующих заданиях Spark. Dataproc Serverless позволяет запускать задания Spark без управления кластерами, что соответствует требованию управляемых сервисов и снижает операционные издержки. Переработка заданий для чтения/записи в Cloud Storage — это минимальное изменение, необходимое для облачной среды. Другие варианты менее подходят: Использование Dataplex для регистрации бакета не заменяет необходимость в Metastore для Spark-заданий, если они ожидают каталог Hive. Перенос данных непосредственно в BigQuery потребует значительной переработки заданий Spark, что противоречит требованию минимальных изменений ETL. BigLake — это не хранилище, а механизм доступа к данным. Dataproc on Compute Engine требует управления кластерами, что не соответствует требованию управляемых сервисов.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется