Amazon DEA-C01: 데이터 저장 및 레이크 아키텍처 — 학습 가이드

다음의 일부입니다: Amazon Data Engineer Associate DEA-C01 — 학습 가이드. 검증된 답안으로 연습하기: Amazon 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.

이 도메인은 AWS 스토리지 서비스와 데이터베이스 엔진이 최신 데이터 플랫폼에서 대규모 데이터 수집, 영구적 아카이빙, 쿼리 성능, 안전한 거버넌스를 어떻게 지원하는지 다룹니다. 데이터 엔지니어는 S3, Lake Formation, Redshift, DynamoDB와 같은 서비스를 파이프라인에 통합하면서 비용, 액세스 지연 시간, 내구성, 세분화된 액세스 제어 간의 균형을 맞춰야 합니다. 스토리지 클래스 간의 장단점, 수명 주기 자동화, 관리형 스토리지와 로컬 스토리지 비교, 파티셔닝 패턴을 이해하면 프로덕션 환경에서 성능 및 비용 관련 예기치 않은 문제를 방지할 수 있습니다.

Amazon S3 스토리지 클래스 및 수명 주기 정책

S3는 비용과 액세스 패턴을 최적화하기 위해 여러 스토리지 클래스와 수명 주기 제어 기능을 제공합니다. 업로드 시 스토리지 클래스를 구성하거나(콘솔 또는 CLI: aws s3 cp file s3://bucket/key –storage-class INTELLIGENT_TIERING) 버킷 수명 주기 규칙을 사용할 수 있습니다(aws s3api put-bucket-lifecycle-configuration –bucket my-bucket –lifecycle-configuration file://lifecycle.json). Intelligent-Tiering은 객체를 빈번한 액세스 계층과 드문 액세스 계층 간에 자동으로 이동시키며, 소액의 모니터링 요금이 부과됩니다. 액세스 패턴을 알 수 없거나 변경될 때 이 기능을 활성화하세요. 수명 주기 규칙을 사용하여 객체를 장기 보존을 위해 GLACIER 또는 DEEP_ARCHIVE로 전환하고 오래된 버전을 만료/삭제할 수 있습니다.

결정 기준 및 장단점:

운영 참고 사항:

S3 및 Lake Formation을 사용한 데이터 레이크 설계

S3를 중앙 객체 스토어로, Lake Formation을 중앙 집중식 액세스 제어 및 카탈로깅 도구로 사용하여 데이터 레이크를 설계합니다. S3 위치를 Lake Formation 리소스로 등록하고, AWS Glue Data Catalog를 설정한 후, 데이터베이스/테이블에 Lake Formation 권한을 부여합니다(aws lakeformation grant-permissions –principal arn:aws:iam::123456789012:user/analyst –permissions SELECT –resource ‘{…}’). Lake Formation은 LF-태그와 Glue/Athena 쿼리에 적용되는 데이터 필터를 사용하여 열 수준, 행 수준(필터 표현식), 셀 수준 마스킹과 같은 세분화된 제어를 적용할 수 있습니다.

주요 구성 및 거버넌스 패턴:

결정 포인트:

Amazon Redshift 아키텍처 및 스토리지

Redshift는 RA3 노드의 컴퓨팅 및 관리형 스토리지와 DS2 노드의 로컬 SSD 기반 스토리지를 분리합니다. RA3 노드는 Redshift Managed Storage(RMS)를 사용하며, 데이터는 클러스터에서 관리하는 Amazon S3에 상주합니다. 일관된 쿼리 성능을 제공하는 확장 가능한 스토리지와 컴퓨팅 비용을 별도로 지불할 수 있는 기능이 필요할 때 RA3를 선택하세요. DS2 노드는 인스턴스 로컬 디스크에 데이터를 저장하므로 데이터가 증가할 때 신중한 크기 조정 및 크기 변경이 필요합니다.

구성 및 운영 세부 정보:

비교 (RA3 vs DS2):

DynamoDB 및 용도별 데이터베이스 선택

한 자릿수 밀리초의 지연 시간이 필요한 대규모 키-값 및 문서 워크로드의 경우 DynamoDB를 선택합니다. 테이블 설계는 파티션 키(및 선택적 정렬 키) 선택에 따라 결정됩니다. 핫 파티션을 방지하려면 카디널리티가 높고 잘 분산된 키를 사용하십시오. 순차적 또는 타임스탬프 기반 키의 경우, 무작위 접두사 추가(샤딩)를 구현하거나 UUID를 사용하여 쓰기를 분산시키십시오. 프로비저닝을 피하려면 온디맨드 용량을 사용하되, 예측 가능한 워크로드와 핫 파티션에 대한 적응형 용량을 활용하려면 오토스케일링을 사용하는 프로비저닝된 용량을 고려하십시오.

실용적인 구성 참고 사항:

엔진 선택을 위한 결정 기준:

일반적인 실수 및 결정 기준

실제 문제: 사용 사례 시나리오

Acme Media는 50TB의 원본 비디오 수집 데이터를 저장하고, 분석가에게 변환된 메타데이터에 대한 쿼리 액세스를 제공하며, 스토리지 비용을 최소화하면서 여러 사업부에 대해 행 및 열 수준 액세스를 강제해야 합니다.

  1. 멀티파트 업로드를 사용하여 원본 비디오를 S3에 수집하고, 수집 날짜 및 데이터 세트별로 객체를 태깅하며, 초기 액세스 패턴을 알 수 없으므로 Intelligent-Tiering을 사용합니다.
  2. 구성 가능한 보존 기간이 지나면 미디어를 GLACIER 또는 DEEP_ARCHIVE로 전환하도록 수명 주기 규칙을 구성합니다(Standard-IA를 고려하는 경우 30일 이상 보관 기간과 일치하도록 보장).
  3. Lake Formation에 S3 위치를 등록하고, Glue 크롤러를 구축하여 데이터 카탈로그를 채우며, 사업부에 LF-태그 기반 행 및 열 수준 권한을 부여합니다.
  4. 분석을 위해 큐레이션된 메타데이터를 Redshift RA3에 저장합니다. S3로부터의 COPY 작업을 위해 클러스터에 IAM 역할을 연결하고, 유지 관리 기간에 VACUUM/ANALYZE 작업을 사용합니다.
  5. 비디오 매니페스트의 처리량이 높은 조회 테이블에 해시된 UUID 키를 사용하는 DynamoDB를 사용하고, 트래픽 급증을 흡수하기 위해 온디맨드 용량을 활성화합니다.

근거: 이 접근 방식은 Glacier 클래스를 사용하여 콜드 스토리지 비용을 분리하고, 알 수 없는 패턴에 Intelligent-Tiering을 사용하며, 분석 엔진 전반에 걸쳐 안전하고 세분화된 액세스 제어를 위해 Lake Formation을 적용하고, 확장 가능한 분석 스토리지를 위해 RA3를 선택하는 동시에 DynamoDB가 지연 시간이 짧은 운영 조회를 처리하도록 합니다.


데이터 인제스천 및 수집 · 모든 도메인 · 데이터 카탈로깅 및 메타데이터 관리

이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

시험 합격하기 →

Amazon 찾아보기 →

Related guides

올인원 액세스

하나의 구독. 모든 시험.

모든 플랜은 무제한 답변 검색, 모의고사, AI 해설, 전체 자료 라이브러리를 20개 이상의 언어로 잠금 해제합니다.

월간
24.87
Just €0.83/day
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

최고의 가치
12개월
179.87
Just €0.49/daySave 40%
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

✓ 무료 플랜 포함 · ✓ 언제든지 취소 가능 · ✓ 모든 플랜은 전체 제품을 잠금 해제합니다