Вы собираетесь создать модель с помощью BigQuery ML и разместить ее в Vertex AI. Потоки от поставщиков поступают непрерывно и могут содержать недопустимые значения. Что следует сделать для обработки и очистки данных в почти реальном времени перед их загрузкой в BigQuery?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Создать топик Pub/Sub и отправлять в него все данные поставщиков. Использовать Dataflow для обработки и очистки данных Pub/Sub и потоковой передачи их в BigQuery..
Почему это правильный ответ
Правильный ответ — использование Pub/Sub и Dataflow. Pub/Sub идеально подходит для приема непрерывных потоков данных от нескольких поставщиков, обеспечивая масштабируемую и надежную буферизацию. Dataflow — это полностью управляемый сервис для обработки потоковых данных, который может выполнять сложную очистку, валидацию и преобразование данных в почти реальном времени, прежде чем они будут загружены в BigQuery. Это позволяет эффективно обрабатывать недопустимые значения и подготавливать данные для BigQuery ML. Остальные варианты менее оптимальны: Использование потоковых вставок BigQuery напрямую для "ingestion" без предварительной обработки не решит проблему недопустимых значений. Развертывание модели ML в BigQuery не помогает с предварительной очисткой данных. Cloud Functions могут быть менее подходящими для обработки больших объемов непрерывных потоков данных из-за ограничений по времени выполнения и памяти, а также сложности управления состоянием по сравнению с Dataflow.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется