Инвестиционная фирма обрабатывает постоянно растущий объем полуструктурированных данных и нуждается в дедупликации записей, удалении дубликатов и распространенных опечаток. Какой вариант обеспечивает эту возможность с наименьшими операционными издержками?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Использовать функцию FindMatches в AWS Glue для удаления дублирующихся записей..
Почему это правильный ответ
Функция FindMatches в AWS Glue специально разработана для идентификации и дедупликации записей в полуструктурированных данных, даже если они не имеют точного совпадения, содержат опечатки или неточные данные. Это достигается с помощью машинного обучения, что снижает операционные издержки по сравнению с ручной настройкой правил. Amazon Athena не имеет встроенных функций для нечеткого сопоставления и дедупликации, требуя сложной логики SQL. Amazon Neptune ML и Apache Gremlin предназначены для графовых баз данных и не подходят для дедупликации полуструктурированных данных. Глобальные таблицы Amazon DynamoDB обеспечивают репликацию и высокую доступность, но не предотвращают дублирование данных на уровне содержимого.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется