AmazonAmazon Data Engineer Associate DEA-C01 Certification·KO·업데이트됨 2 Aug 2026
한 회사에서 세미 정형 트랜잭션 데이터를 S3에 저장합니다. 일부 파일은 매우 작고 다른 파일은 수십 테라바이트에 달합니다. 소스는 매일 한 번 전체 JSON 스냅샷을 보내고 변경된 레코드를 데이터 레이크로 보냅니다. 데이터 엔지니어는 가장 비용 효율적인 방법으로 변경 사항을 식별하기 위해 CDC(Change Data Capture)를 수행해야 합니다. 어떤 솔루션이 가장 비용 효율적일까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 오픈 소스 데이터 레이크 형식을 사용하여 데이터 소스를 S3 데이터 레이크와 병합하여 새 데이터를 삽입하고 기존 데이터를 업데이트합니다..
이것이 정답인 이유
오픈 소스 데이터 레이크 형식(예: Apache Hudi, Apache Iceberg 또는 Delta Lake)은 S3에 저장된 데이터에 대한 ACID 트랜잭션을 지원하여 변경 사항을 효율적으로 식별하고 적용할 수 있습니다. 이를 통해 작은 파일과 큰 파일이 혼합된 환경에서 새 데이터를 삽입하고 기존 데이터를 업데이트하는 작업을 최적화하여 비용 효율적인 CDC를 구현할 수 있습니다. Lambda 함수를 사용하는 방법은 대규모 데이터 세트에서 변경 사항을 식별하는 데 비효율적이고 비용이 많이 들 수 있습니다. Amazon RDS 또는 Aurora Serverless와 AWS DMS를 사용하는 방법은 추가 데이터베이스 인프라를 도입하여 불필요한 비용을 발생시키고 복잡성을 증가시킵니다.