사기 탐지 모델용 50MB Apache Parquet 파일을 받았는데, 이 파일에는 상관 관계가 있고 불필요한 열이 여러 개 포함되어 있습니다. 이 파일에서 해당 열을 제거하는 가장 적은 노력의 방법은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: SageMaker Data Wrangler에서 데이터 흐름을 생성하고 불필요한 열을 삭제하는 변환 단계를 추가합니다..
이것이 정답인 이유
SageMaker Data Wrangler는 시각적 인터페이스를 통해 데이터 준비 작업을 간소화합니다. 데이터 흐름을 생성하고 불필요한 열을 삭제하는 변환 단계를 추가하는 것은 코드를 작성할 필요 없이 상관 관계가 있는 불필요한 열을 제거하는 가장 적은 노력의 방법입니다. 이는 특히 50MB 파일과 같이 크지 않은 데이터셋에 적합합니다. 다른 옵션들은 더 많은 노력과 복잡성을 요구합니다. 로컬 워크스테이션에서 Python 스크립트를 사용하는 것은 수동 작업이 필요하며, 대규모 데이터셋에는 비효율적일 수 있습니다. Amazon EMR에서 Apache Spark 작업을 생성하는 것은 클러스터 관리와 Spark 코드 작성이 필요하여 더 복잡합니다. SageMaker Python SDK를 호출하여 SageMaker 처리 작업을 시작하는 것도 코드를 작성해야 하므로 Data Wrangler보다 더 많은 노력이 필요합니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음