분석을 위해 시계열 트랜잭션 데이터를 BigQuery로 복사하는 파이프라인이 필요합니다. 데이터세트의 초기 크기는 1.5PB이고 매일 3TB씩 증가하며, 수천 개의 트랜잭션이 시간별로 새 상태로 업데이트됩니다. 데이터는 고도로 구조화되어 있으며 ML에 사용됩니다. 성능과 유용성을 극대화하기 위해 어떤 두 가지 전략을 채택하시겠습니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 데이터를 최대한 비정규화합니다., 상태 업데이트가 업데이트되는 대신 BigQuery에 추가되는 데이터 파이프라인을 개발합니다..
이것이 정답인 이유
BigQuery는 분석 데이터 웨어하우스이므로 데이터를 최대한 비정규화하여 조인 오버헤드를 줄이고 쿼리 성능을 향상시키는 것이 좋습니다. 또한 BigQuery는 업데이트 작업에 최적화되어 있지 않으므로, 기존 레코드를 업데이트하는 대신 새로운 상태 업데이트를 추가하는 것이 비용 효율적이고 성능이 좋습니다. 이는 변경 불가능한 데이터 패턴을 따르며, 기록 추적 및 감사에도 유리합니다. 데이터의 구조를 보존하는 것은 OLTP 시스템에는 적합하지만 OLAP 시스템인 BigQuery에는 비효율적입니다. BigQuery UPDATE는 대규모 데이터셋에서 비용이 많이 들고 성능이 저하될 수 있습니다. Cloud Storage에 스냅샷을 저장하고 외부 테이블로 쿼리하는 것은 BigQuery의 기본 스토리지 성능을 활용하지 못하며, 특히 ML 사용 사례에서 성능 저하를 초래할 수 있습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음