Amazon DEA-C01: 데이터 쿼리 및 분석 — 학습 가이드

다음의 일부입니다: Amazon Data Engineer Associate DEA-C01 — 학습 가이드. 검증된 답안으로 연습하기: Amazon 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.

이 도메인은 대규모 데이터셋에 대한 분석 쿼리 및 BI를 지원하는 AWS 서비스의 설계, 튜닝, 운영을 다룹니다. Athena, Redshift, OpenSearch, QuickSight 전반에 걸친 비용 효율적이고 고성능인 쿼리 패턴과, 이 서비스들이 S3, Glue, 트랜잭션 스토어와 어떻게 상호 운용되는지에 중점을 둡니다. 이 분야를 마스터하려면 스토리지 포맷, 파티셔닝, 컴퓨팅 유형, 데이터 배치 간의 균형을 맞춰 스캔되는 바이트와 네트워크 스큐(skew)를 최소화하면서 지연 시간이 짧은 인사이트를 제공해야 합니다.

Amazon Athena 쿼리 최적화

Athena의 요금은 스캔한 바이트를 기준으로 책정되므로, 물리적 데이터 레이아웃과 메타데이터가 주요 최적화 요소입니다. 컬럼 기반 포맷(Parquet 또는 ORC)과 압축(Parquet의 경우 Snappy, Zlib/ORC 옵션)을 사용하여 크기와 CPU 사용량을 줄이십시오. 카디널리티가 높고 쿼리에서 필터링되는 컬럼(예: 날짜, 리전)을 기준으로 데이터를 파티셔닝하고, Glue Data Catalog에 파티션을 등록하십시오. 일반적인 패턴:

쿼리가 트랜잭션 스토어와의 조인을 필요로 할 때, Athena Federated Query(Lambda 커넥터)를 사용하여 RDS, DynamoDB 또는 Redshift와 교차 소스 조인을 수행합니다. 커넥터는 Lambda 함수로 배포되고 Athena에 데이터 소스로 등록됩니다. 콘솔 흐름 예시: Athena > 데이터 원본 > 커넥터 > 새로 만들기. 결정 기준:

Amazon Redshift 쿼리 튜닝 및 분산

Redshift 성능은 데이터 이동을 최소화하고 존 맵(zone map)을 활성화하기 위한 분산 스타일(distribution style)과 정렬 키(sort key)에 따라 결정됩니다. 다음 결정 포인트를 사용하여 DIST 스타일을 선택하십시오:

범위 필터나 ORDER BY에 사용되는 컬럼에 SORTKEY를 정의하여 존 맵을 활성화하고 디스크 읽기를 줄입니다. 일반적인 운영 명령어:

로그 분석을 위한 Amazon OpenSearch Service

OpenSearch는 수집 및 빠른 임시(ad-hoc) 로그 분석에 최적화되어 있습니다. 인덱스와 클러스터 구성이 처리량과 비용을 결정합니다. 인덱스 설계 및 수명 주기:

BI 및 시각화를 위한 QuickSight

QuickSight는 두 가지 주요 수집 모드인 SPICE(인메모리)와 직접 쿼리(direct query)를 통해 빠른 대시보드를 제공합니다. SPICE는 대시보드에 대해 1초 미만의 성능을 제공하며 반복적인 읽기에 적합합니다. 직접 SQL 쿼리(Athena, Redshift, RDS 대상)는 매우 큰 데이터셋이나 자주 변경되는 데이터에 더 적합합니다. 주요 구성 및 모범 사례:

일반적인 함정과 결정 기준

실제 문제: 사용 사례 시나리오

Acme Retail은 Amazon RDS의 트랜잭션 주문, S3의 클릭스트림 이벤트, DynamoDB의 사용자 프로필을 결합한 일일 BI 보고서가 필요하며, 비용 제한이 있고 최신 데이터에 대해서는 1분 미만의 대시보드 새로 고침이 요구됩니다.

  1. S3의 클릭스트림 데이터를 날짜 기반으로 파티셔닝된 Parquet으로 변환하고, Snappy로 압축한 후, 크롤러를 통해 AWS Glue에 메타데이터를 등록합니다.
  2. S3에 대한 임시 쿼리에는 Athena를 사용하고, RDS 및 DynamoDB용 Federated Query 커넥터를 배포하여 작은 차원 테이블과의 조인을 수행합니다. 쿼리가 반복되는 경우, 자주 사용되는 조인 결과는 Parquet으로 구체화합니다.
  3. 무거운 분석 조인을 위해 Redshift를 프로비저닝합니다. 집계된 스냅샷을 Redshift에 로드하고, 카디널리티가 높은 customer_id에 DISTKEY를 설정하며, order_date에 SORTKEY를 정의합니다. 오래된 S3의 기록 데이터에는 Spectrum을 사용합니다.
  4. 일별 인덱스 패턴을 사용하여 애플리케이션 로그를 OpenSearch로 수집합니다. ILM을 적용하여 최신 인덱스는 핫 노드에 유지하고, 오래된 인덱스는 비용 절감을 위해 UltraWarm으로 이동시킵니다.
  5. QuickSight 대시보드를 구축합니다. 1분 미만의 체감 응답성을 위해 예약된 증분 새로 고침을 사용하여 최신 집계 데이터를 SPICE로 가져오고, 항상 최신 상태여야 하는 지표에는 직접 쿼리를 사용합니다.

근거: 이 접근 방식은 파티셔닝과 컬럼 기반 형식을 통해 Athena 스캔 비용을 최소화하고, 적절한 분산 키와 정렬 키로 Redshift 네트워크 셔플을 줄이며, Spectrum을 사용하여 오래된 데이터를 Redshift에 저장하는 것을 피하고, OpenSearch ILM을 적용하여 스토리지 비용을 최적화하며, 직접 쿼리를 통해 중요한 데이터의 최신성을 유지하면서 SPICE를 활용하여 반응성이 뛰어난 대시보드를 제공합니다.


데이터 오케스트레이션 및 워크플로우 관리 · 모든 도메인 · 데이터 보안

이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

시험 합격하기 →

Amazon 찾아보기 →

Related guides

올인원 액세스

하나의 구독. 모든 시험.

모든 플랜은 무제한 답변 검색, 모의고사, AI 해설, 전체 자료 라이브러리를 20개 이상의 언어로 잠금 해제합니다.

월간
24.87
Just €0.83/day
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

최고의 가치
12개월
179.87
Just €0.49/daySave 40%
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

✓ 무료 플랜 포함 · ✓ 언제든지 취소 가능 · ✓ 모든 플랜은 전체 제품을 잠금 해제합니다