ML 엔지니어는 중앙 S3 버킷에 저장된 수천 개의 기존 CSV 파일과 새로 업로드되는 CSV 파일을 처리해야 합니다. 모든 CSV는 동일한 열 레이아웃을 공유하며 쿼리해야 하는 트랜잭션 날짜 열을 포함합니다. 운영 오버헤드가 가장 적은 솔루션은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: Amazon Athena CREATE TABLE AS SELECT (CTAS)를 실행하여 S3 데이터에 대한 테이블(트랜잭션 날짜별로 파티션되거나 필터링됨)을 구축한 다음 해당 테이블을 쿼리합니다..
이것이 정답인 이유
가장 적은 운영 오버헤드로 대량의 S3 CSV 데이터를 쿼리하는 데 Amazon Athena가 최적입니다. Athena는 서버리스 서비스로, 인프라를 프로비저닝하거나 관리할 필요 없이 S3 데이터를 직접 쿼리할 수 있습니다. CREATE TABLE AS SELECT (CTAS) 문을 사용하면 트랜잭션 날짜별로 데이터를 파티셔닝하거나 필터링하여 쿼리 성능을 최적화하고 스캔되는 데이터 양을 줄일 수 있습니다. 다른 옵션들은 다음과 같은 이유로 적합하지 않습니다. S3 Object Lambda는 객체 검색 시 데이터를 변환하는 데 사용되지만, 대규모 데이터 쿼리 및 파티셔닝에는 적합하지 않습니다. AWS Glue for Apache Spark 작업은 데이터 변환 및 ETL에 강력하지만, 서버리스 Athena에 비해 더 많은 운영 오버헤드(잡 관리, 클러스터 구성 등)가 발생합니다. Amazon Kinesis Data Firehose는 스트리밍 데이터를 대상으로 하며, 이미 S3에 저장된 기존 CSV 파일에는 적합하지 않습니다. 또한 Lambda 함수를 통한 쿼리는 대규모 데이터셋에 비효율적입니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음