서버리스 SQL 기반 접근 방식을 사용하여 느린 PySpark 배치 파이프라인을 재구축하려고 합니다. 원시 데이터는 Cloud Storage에 있습니다. 개발 및 런타임 속도를 높이려면 파이프라인을 어떻게 구현해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: Cloud Storage에서 BigQuery로 데이터를 로드하고, PySpark 변환을 BigQuery SQL로 변환한 다음, 결과를 새 BigQuery 테이블에 씁니다..
이것이 정답인 이유
느린 PySpark 배치 파이프라인을 서버리스 SQL 기반으로 재구축하는 가장 효율적인 방법은 Cloud Storage의 원시 데이터를 BigQuery로 로드하고, PySpark 변환 로직을 BigQuery SQL로 변환하여 BigQuery 내에서 직접 실행하는 것입니다. BigQuery는 완전 관리형 서버리스 데이터 웨어하우스로, 대규모 데이터 세트에서 SQL 쿼리를 매우 빠르게 처리할 수 있어 개발 및 런타임 속도를 크게 향상시킵니다. 다른 옵션들은 다음과 같은 이유로 최적이 아닙니다. PySpark 명령을 SparkSQL로 변환하고 Dataproc에서 실행하는 것은 여전히 관리형 Spark 클러스터를 사용하므로 완전한 서버리스 접근 방식이 아니며, Dataproc 클러스터 관리 오버헤드가 발생합니다. 데이터를 Cloud SQL로 수집하는 것은 대규모 데이터 처리에는 적합하지 않으며, BigQuery의 성능 이점을 활용하지 못합니다. BigQuery 연합 쿼리는 외부 데이터 소스에 대한 쿼리이므로 BigQuery 내부 테이블 쿼리보다 느릴 수 있습니다. Apache Beam Python SDK로 변환을 다시 구현하는 것은 서버리스 옵션이지만, SQL 기반 접근 방식이 아니므로 문제의 요구 사항과 일치하지 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음