한 회사에서 재고 확인을 위해 데이터 레이크의 데이터를 분기별로 분석합니다. 데이터 엔지니어는 AWS Glue DataBrew를 사용하여 데이터에서 고객의 개인 식별 정보(PII)를 찾습니다. 회사의 개인 정보 보호 규칙에는 DataBrew의 내장된 데이터 품질 규칙에 포함되지 않은 일부 사용자 지정 PII 카테고리가 있습니다. 엔지니어는 데이터 레이크의 여러 데이터 세트에서 이러한 사용자 지정 PII 카테고리를 스캔하도록 프로세스를 업데이트해야 합니다. 운영 오버헤드가 가장 적으면서 요구 사항을 충족하는 접근 방식은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: DataBrew에서 사용자 지정 데이터 품질 규칙을 생성하고 해당 규칙을 데이터 세트 전체에 적용합니다..
이것이 정답인 이유
DataBrew에서 사용자 지정 데이터 품질 규칙을 생성하고 해당 규칙을 데이터 세트 전체에 적용하는 것이 가장 효율적입니다. DataBrew는 내장된 데이터 품질 규칙 외에도 사용자 지정 규칙을 정의할 수 있는 기능을 제공하여 특정 PII 카테고리를 정확하게 식별할 수 있습니다. 이렇게 하면 여러 데이터 세트에 걸쳐 일관된 검사를 적용할 수 있으며, DataBrew의 관리형 서비스 특성으로 인해 운영 오버헤드가 최소화됩니다. 데이터 세트를 수동으로 검토하는 것은 시간이 많이 걸리고 오류가 발생하기 쉬우며 확장성이 없습니다. 사용자 지정 Python 스크립트를 작성하는 것은 개발 및 유지 관리에 추가적인 노력이 필요하며, DataBrew의 통합된 기능을 활용하지 못합니다. ETL 프로세스 중에 정규 표현식을 사용하는 것은 PII를 추출하는 데 효과적일 수 있지만, DataBrew의 데이터 품질 관리 기능을 직접 활용하는 것보다 유연성이 떨어지고, PII 감지 및 보고를 위한 별도의 로직을 구현해야 할 수 있습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음