StreamVid는 S3에 수 테라바이트의 원시 CSV 로그를 보관하고 있으며, 학습 전에 자동화된 프로파일링 및 반복 가능한 변환(타임스탬프 구문 분석, 낮은 카디널리티 열 삭제, Parquet으로 변환)이 필요합니다. 이러한 요구 사항을 가장 잘 충족하는 DataBrew 워크플로는 무엇이며, 예약된 실행을 위해 무엇을 보장해야 합니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: S3 경로를 가리키는 DataBrew 데이터 세트를 생성하고, 통계를 생성하기 위해 프로필 작업을 실행하고, 필요한 단계(타임스탬프 구문 분석, 열 삭제, Parquet으로 변환)로 레시피를 작성한 다음, Parquet 출력을 S3에 다시 쓰는 DataBrew 작업을 생성합니다. DataBrew 작업을 예약하고 작업 역할에 S3 읽기/쓰기 권한이 있는지, 그리고 데이터 세트 경로가 작업의 VPC(지정하는 경우)에서 도달 가능한지 확인해야 합니다..
이것이 정답인 이유
이 DataBrew 워크플로는 요구 사항을 가장 잘 충족합니다. DataBrew는 S3의 원시 CSV 로그를 직접 처리할 수 있으며, 데이터 세트 프로파일링을 위한 프로필 작업과 타임스탬프 구문 분석, 열 삭제, Parquet 변환과 같은 반복 가능한 변환을 위한 레시피를 지원합니다. 또한 DataBrew 작업은 예약될 수 있으며, Parquet 형식으로 S3에 다시 쓸 수 있습니다. 예약된 실행을 위해서는 작업 역할에 S3 읽기/쓰기 권한이 있어야 하고, 데이터 세트 경로가 작업의 VPC(지정된 경우)에서 접근 가능해야 합니다. 다른 옵션들은 다음과 같은 이유로 적절하지 않습니다. DataBrew는 Parquet 출력을 생성하고 작업을 예약할 수 있으므로, DataBrew를 사용하지 않고 Glue ETL을 사용하는 것은 불필요합니다. 또한 Glue 크롤러는 프로파일링에 적합하지 않으며, IAM 사용자 자격 증명을 사용하는 것은 모범 사례가 아닙니다. SageMaker Data Wrangler는 프로파일링 및 레시피 작성을 지원하지만, DataBrew가 Parquet 출력을 생성하고 예약된 실행을 할 수 없다는 전제는 잘못되었습니다. Lambda 함수는 복잡한 데이터 변환 및 프로파일링에 적합하지 않으며, 관리 오버헤드가 크고 DataBrew가 제공하는 시각적 인터페이스 및 내장 기능을 활용하지 못합니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음