Компания собирает данные из множества источников в бакет S3, запускает задание AWS Glue ETL для их преобразования и сохраняет преобразованные выходные данные в озере данных на базе S3, к которому обращается Amazon Athena. Компании необходимо идентифицировать совпадающие записи, даже если нет общего уникального идентификатора. Какое решение позволит это сделать?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Обучить и использовать преобразование AWS Lake Formation FindMatches в задании ETL..
Почему это правильный ответ
Правильный ответ — обучить и использовать преобразование AWS Lake Formation FindMatches в задании ETL. AWS Lake Formation FindMatches — это преобразование машинного обучения, специально разработанное для идентификации совпадающих записей в наборах данных, даже если отсутствуют общие уникальные идентификаторы. Оно использует алгоритмы машинного обучения для обнаружения дубликатов на основе сходства данных. Использование сопоставления шаблонов Amazon Macie не подходит, так как Macie в первую очередь предназначен для обнаружения конфиденциальных данных и не предназначен для идентификации совпадающих записей в контексте дедупликации данных. Класс AWS Glue PySpark Filter не может быть использован для этой цели, так как он предназначен для фильтрации данных на основе заданных условий, а не для обнаружения нечетких совпадений. Разделение таблиц на разделы и использование уникального идентификатора не решит проблему, поскольку в задаче явно указано отсутствие общего уникального идентификатора.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется