온프레미스 Spark 작업에서 매일 Parquet을 처리하고 있습니다. Google Cloud로 마이그레이션하면서 관리형 서비스, 최소한의 ETL 변경, 향후 파이프라인을 위한 BigQuery 가용성을 원합니다. 어떻게 해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 데이터를 Cloud Storage로 마이그레이션하고 메타데이터를 Dataproc Metastore(DPMS)로 마이그레이션합니다. Spark 작업을 Cloud Storage를 읽고 쓰도록 리팩터링하고 Dataproc Serverless에서 실행합니다..
이것이 정답인 이유
이 옵션은 관리형 서비스, 최소한의 ETL 변경, BigQuery 가용성이라는 요구 사항을 모두 충족합니다. Cloud Storage는 Parquet 파일을 저장하기 위한 확장 가능하고 비용 효율적인 솔루션입니다. Dataproc Metastore(DPMS)는 온프레미스 Hive Metastore를 관리형 서비스로 마이그레이션하여 기존 Spark 작업의 메타데이터 호환성을 유지할 수 있도록 합니다. Dataproc Serverless는 Spark 작업을 서버리스 방식으로 실행하여 인프라 관리를 최소화하고, Cloud Storage의 데이터에 직접 접근하며, BigQuery와 통합이 용이하여 향후 파이프라인 확장에 유리합니다. 다른 옵션들은 다음과 같은 이유로 적합하지 않습니다. Dataplex는 데이터 거버넌스 도구이지만, Dataproc Metastore처럼 Hive Metastore 호환성을 직접 제공하지는 않습니다. 데이터를 BigQuery로 직접 마이그레이션하는 것은 Parquet 파일 처리라는 현재 요구 사항과 맞지 않으며, Spark 작업 리팩토링에 더 많은 노력이 필요할 수 있습니다. BigLake는 BigQuery와 Cloud Storage 간의 통합을 제공하지만, 데이터 저장소가 아니며, Compute Engine의 Dataproc은 관리형 서비스 요구 사항을 부분적으로만 충족합니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음