대용량 스트리밍 JSON 이벤트에 대한 서버리스 실시간 수집 및 분석 파이프라인이 필요합니다. 이 파이프라인은 데이터를 버퍼링하고, 데이터 손실 없이 JSON을 쿼리에 최적화된 컬럼형 형식으로 변환하며, 고가용성 데이터 저장소에 결과를 저장하고, 분석가가 SQL 쿼리를 실행하고 BI 대시보드를 연결할 수 있도록 해야 합니다. 다음 중 이러한 요구 사항을 가장 잘 충족하는 설계는 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 들어오는 형식에 대해 관리형 Data Catalog에 스키마를 정의합니다. 관리형 스트리밍 전송 서비스를 사용하여 이벤트를 수집하고, Data Catalog를 사용하여 이벤트를 컬럼형 형식(Parquet 또는 ORC)으로 변환한 다음, 결과를 객체 스토리지로 전송합니다. 분석가는 서버리스 SQL 쿼리 엔진을 사용하여 객체 스토리지를 쿼리하고 JDBC 커넥터로 BI 도구를 연결합니다..
이것이 정답인 이유
정답은 관리형 스트리밍 전송 서비스(예: Kinesis Data Firehose)를 사용하여 데이터를 수집하고, Data Catalog(예: AWS Glue Data Catalog)에 스키마를 정의하여 JSON을 Parquet 또는 ORC와 같은 쿼리에 최적화된 컬럼형 형식으로 변환한 후 객체 스토리지(예: Amazon S3)에 저장하는 것입니다. 서버리스 SQL 쿼리 엔진(예: Amazon Athena)은 S3의 데이터를 직접 쿼리할 수 있으며, JDBC 커넥터를 통해 BI 도구와 연결됩니다. 이 설계는 모든 요구 사항(서버리스, 실시간 수집, 데이터 손실 없음, 컬럼형 변환, 고가용성 저장소, SQL 쿼리 및 BI 연결)을 가장 효율적으로 충족합니다. 다른 옵션들은 다음과 같은 이유로 최적의 해결책이 아닙니다. 두 번째 옵션은 각 JSON 레코드를 개별적으로 처리하여 Parquet/ORC로 변환하는 방식인데, 이는 대용량 스트리밍 데이터에 비효율적이며, 데이터 버퍼링 및 데이터 손실 방지 요구 사항을 충족하기 어렵습니다. 세 번째 옵션은 관계형 데이터베이스에 저장하는 방식인데, 이는 대용량 스트리밍 데이터 분석에 적합하지 않으며, 비용 효율성 및 확장성 측면에서 객체 스토리지보다 불리합니다. 네 번째 옵션은 실시간 SQL 스트림 처리 서비스를 사용하지만, Data Catalog를 통한 스키마 관리 및 변환 과정이 명확하지 않아 데이터 거버넌스 및 최적화 측면에서 부족할 수 있습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음