Компания считывает данные из нескольких клиентских баз данных Amazon RDS, где имена и форматы полей непоследовательны (например, place_id в одной базе данных и location_id в другой). Бизнес должен связывать записи клиентов между базами данных, даже если имена полей различаются. Какое решение обеспечивает эту возможность с НАИМЕНЬШИМИ операционными издержками?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Создать AWS Glue crawler для сканирования баз данных. Использовать преобразование FindMatches для поиска дублирующихся записей в данных. Оценить и настроить преобразование, проанализировав производительность и результаты..
Почему это правильный ответ
Правильный ответ — использование AWS Glue crawler для сканирования баз данных и преобразования FindMatches. AWS Glue crawler автоматически обнаруживает схемы данных, даже при непоследовательных именах полей, и создает таблицы в AWS Glue Data Catalog. Преобразование FindMatches в AWS Glue DataBrew или AWS Glue Studio специально разработано для идентификации дублирующихся или связанных записей в наборах данных, даже если они не имеют общего уникального идентификатора или имеют несовместимые форматы. Это решение минимизирует операционные издержки, поскольку AWS Glue является бессерверным и управляет инфраструктурой, а FindMatches предоставляет готовый алгоритм машинного обучения для сопоставления записей без необходимости написания сложного кода. Остальные варианты требуют больше операционных издержек. Использование Amazon EMR или Amazon SageMaker для создания конвейеров Apache Spark ML или моделей Apache Spark ML означает управление кластерами, настройку среды и разработку, а также обслуживание собственного кода машинного обучения, что значительно сложнее и дороже.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется