한 회사에 Amazon Redshift 클러스터에 10TB의 데이터가 있습니다. 데이터 엔지니어링 팀은 분석 및 모델 개발을 위해 SageMaker Studio를 사용하지만, Redshift 데이터의 일부만 훈련에 필요합니다. 모델 개발을 위해 관련 하위 집합을 Amazon S3로 안전하고 비용 효율적으로 내보내는 방법이 필요합니다. 다음 솔루션 중 이러한 요구 사항을 충족하는 것은 무엇입니까? (두 가지 선택)
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: Redshift 자격 증명을 AWS Secrets Manager에 저장합니다. SageMaker Studio 노트북에서 해당 자격 증명을 검색하고 Python 데이터베이스 어댑터를 사용하여 관련 데이터를 쿼리하고 결과를 Amazon S3로 내보냅니다., SageMaker Data Wrangler를 사용하여 관련 Redshift 데이터를 쿼리하고 시각화하며, 선택한 하위 집합을 Amazon S3로 직접 내보냅니다..
이것이 정답인 이유
첫 번째 정답은 SageMaker Studio 노트북에서 Python 데이터베이스 어댑터를 사용하여 Redshift에서 데이터를 직접 쿼리하고 S3로 내보내는 실용적인 방법입니다. AWS Secrets Manager를 사용하여 Redshift 자격 증명을 안전하게 관리하는 것은 모범 사례입니다. 두 번째 정답인 SageMaker Data Wrangler는 Redshift와 같은 다양한 데이터 소스에서 데이터를 시각적으로 탐색, 변환 및 준비할 수 있는 강력한 도구입니다. 이는 코드를 작성하지 않고도 관련 데이터를 쉽게 선택하고 S3로 내보낼 수 있는 효율적인 솔루션입니다.
오답인 분산 SageMaker Processing 작업은 쿼리 및 시각화에 과도하며, PySpark 커널을 사용하는 것은 노트북 인스턴스로 10TB의 데이터를 다운로드하는 데 비효율적입니다. 초대형 노트북 인스턴스에 데이터를 다운로드하는 것은 비용 효율적이지 않고 비실용적입니다.