Вам необходимо объединить два набора данных — заказы клиентов и описания каталога продуктов — которые имеют разные структуры и форматы, сопоставляя похожие записи и удаляя дубликаты. Какое решение является наиболее подходящим для сопоставления и очистки этих данных?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Запустить AWS Glue crawlers для заполнения Glue Data Catalog и использовать преобразование Glue FindMatches для идентификации похожих записей и дедупликации данных..
Почему это правильный ответ
Правильный ответ — запустить AWS Glue crawlers для заполнения Glue Data Catalog и использовать преобразование Glue FindMatches для идентификации похожих записей и дедупликации данных. AWS Glue FindMatches — это специализированное преобразование машинного обучения в AWS Glue, предназначенное именно для идентификации неточных совпадений и дубликатов в наборах данных, даже если записи не имеют общего уникального идентификатора. Оно идеально подходит для объединения данных с разными структурами и форматами. Написание функции AWS Lambda для сравнения полей и удаления дубликатов было бы слишком сложным и неэффективным для больших и разнообразных наборов данных, так как оно требует ручной реализации сложной логики сопоставления. Использование Glue SearchTables API для нечёткого сопоставления не является его основной функцией; API предназначен для поиска таблиц в каталоге, а не для сопоставления данных внутри таблиц. Lake Formation в основном используется для управления доступом и безопасностью данных в озере данных, а не для выполнения сложных преобразований сопоставления и дедупликации данных.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется