Компания ежеквартально анализирует данные в озере данных для проведения инвентаризации. Инженер данных использует AWS Glue DataBrew для поиска любой персонально идентифицируемой информации (PII) о клиентах в данных. Правила конфиденциальности компании включают некоторые пользовательские категории PII, которые не являются частью встроенных правил качества данных DataBrew. Инженер должен обновить процесс для сканирования этих пользовательских категорий PII по многим наборам данных в озере данных. Какой подход соответствует требованию с наименьшими операционными издержками?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Создать пользовательские правила качества данных в DataBrew и применить их ко всем наборам данных..
Почему это правильный ответ
Создание пользовательских правил качества данных в DataBrew — это наиболее эффективный способ решения этой задачи. DataBrew позволяет определять собственные правила для обнаружения специфических шаблонов данных, включая пользовательские категории PII. После определения эти правила можно легко применить к множеству наборов данных без необходимости написания или поддержки дополнительного кода, что минимизирует операционные издержки. Ручной просмотр наборов данных не масштабируется и подвержен ошибкам. Написание пользовательских скриптов Python увеличивает сложность и операционные расходы на их поддержку и интеграцию. Использование регулярных выражений во время ETL может быть эффективным для некоторых случаев, но не обеспечивает централизованного управления и повторного использования правил, как это делает DataBrew, и может усложнить конвейер ETL.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется