GoogleGoogle Professional Data Engineer (PDE) Certification·KO·업데이트됨 21 Aug 2026
수백 개의 테이블을 처리하기 위한 효율적이고 유지보수 가능한 워크플로가 필요합니다. 파일은 Cloud Storage에 예측할 수 없게 저장되고, Dataproc이 변환하여 BigQuery에 기록한 다음, 테이블별 BigQuery 변환이 실행됩니다(몇 시간이 걸릴 수 있음). 어떤 워크플로 설계가 가장 좋을까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 1. Cloud Composer에서 Dataproc 및 BigQuery 연산자를 사용하여 Airflow DAG를 빌드합니다. 2. 테이블당 별도의 DAG를 생성합니다. 3. Cloud Storage 객체 트리거를 사용하여 DAG를 트리거하는 Cloud Function을 시작합니다..
이것이 정답인 이유
이 접근 방식은 각 테이블의 독립적인 처리를 허용하여 수백 개의 테이블을 효율적으로 관리합니다. Cloud Storage 객체 트리거를 사용하는 Cloud Functions는 파일이 도착할 때마다 워크플로를 즉시 시작하여 예측 불가능한 데이터 도착에 대응합니다. 테이블당 별도의 DAG를 생성하면 각 테이블의 특정 변환 로직을 격리하고, 오류 발생 시 다른 테이블의 처리에 영향을 주지 않으면서 개별적으로 재시도하거나 디버깅할 수 있습니다. Cloud Composer는 Dataproc 및 BigQuery 연산자를 통해 복잡한 오케스트레이션을 위한 강력한 도구를 제공합니다.
다른 옵션들은 다음과 같은 이유로 최적이 아닙니다.
단일 공유 DAG는 한 테이블의 실패가 다른 모든 테이블에 영향을 미치고, 특정 테이블의 긴 BigQuery 변환으로 인해 다른 테이블의 처리가 지연될 수 있어 유지보수 및 확장이 어렵습니다.
시간 단위 예약은 예측 불가능한 파일 도착에 즉시 반응하지 못하고, 데이터가 도착하기 전에 불필요하게 실행되거나 데이터가 도착한 후 지연될 수 있습니다.