Вы хотите перестроить медленный пакетный конвейер PySpark, используя бессерверный подход на основе SQL. Исходные данные находятся в Cloud Storage. Как следует реализовать конвейер для ускорения разработки и выполнения?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Загрузить данные в BigQuery из Cloud Storage, перевести преобразования PySpark в BigQuery SQL и записать результаты в новую таблицу BigQuery..
Почему это правильный ответ
Правильный ответ — загрузить данные в BigQuery из Cloud Storage, перевести преобразования PySpark в BigQuery SQL и записать результаты в новую таблицу BigQuery. Это позволяет использовать бессерверные возможности BigQuery для SQL-преобразований, что значительно ускоряет разработку и выполнение по сравнению с PySpark. BigQuery оптимизирован для больших объемов данных и обеспечивает высокую производительность. Остальные варианты менее оптимальны: Использование Dataproc с SparkSQL хоть и является Spark-решением, но не является полностью бессерверным и требует управления кластером, что противоречит цели ускорения разработки и выполнения через бессерверный подход. Загрузка данных в Cloud SQL не подходит для больших объемов данных, характерных для пакетных конвейеров, и не является оптимальным выбором для аналитических рабочих нагрузок. Федеративные запросы из BigQuery к Cloud SQL также будут медленнее, чем прямая работа с данными в BigQuery. Перереализация с Apache Beam Python SDK — это изменение фреймворка, которое требует значительных усилий по переписыванию кода, а не просто перевода PySpark в SQL, что не соответствует цели ускорения разработки.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется