한 소매 회사가 매일 소매 주문 CSV 파일을 단일 S3 경로에 로드하고 Amazon Redshift Spectrum을 사용하여 100개 이상의 열 데이터의 하위 집합을 쿼리합니다. 타사 소스는 매일 30개 이상의 CSV 파일(각 50~70MB)을 생성합니다. 사용자는 일별 지표를 집계하지만 쿼리 성능이 저하되었습니다. 개발 노력을 최소화하면서 성능 문제를 해결할 수 있는 작업 조합은 무엇입니까? (두 가지 선택)
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 타사 애플리케이션이 파일을 컬럼형 형식으로 생성하도록 구성합니다., S3 버킷의 주문 데이터를 주문 날짜별로 파티셔닝합니다..
이것이 정답인 이유
정답은 "타사 애플리케이션이 파일을 컬럼형 형식으로 생성하도록 구성합니다"와 "S3 버킷의 주문 데이터를 주문 날짜별로 파티셔닝합니다"입니다. Redshift Spectrum은 S3에 저장된 데이터를 쿼리할 때 컬럼형 형식(예: Parquet 또는 ORC)으로 저장된 데이터에서 더 나은 성능을 보입니다. 이는 필요한 열만 읽어 I/O를 줄이기 때문입니다. 또한, 주문 날짜별로 데이터를 파티셔닝하면 Redshift Spectrum이 쿼리 시 관련 파티션만 스캔하여 스캔되는 데이터 양을 크게 줄이고 쿼리 성능을 향상시킵니다. "매일 여러 CSV 파일을 하루에 하나의 파일로 결합하는 AWS Glue ETL 작업을 개발합니다"는 파일 수를 줄여 S3 오버헤드를 줄일 수 있지만, 컬럼형 형식으로 변환하거나 파티셔닝하는 것만큼 쿼리 성능을 크게 개선하지 못합니다. "타사 애플리케이션이 파일을 JSON 형식으로 생성하도록 구성합니다"는 JSON이 행 기반 형식이고 일반적으로 CSV보다 파싱 오버헤드가 더 크기 때문에 성능을 저하시킬 수 있습니다. "JSON 데이터를 SUPER 유형 열의 Amazon Redshift 테이블로 로드합니다"는 Redshift Spectrum이 아닌 Redshift 내부 테이블에 해당하며, S3 데이터 쿼리 성능 문제와는 직접적인 관련이 없습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음