서로 다른 숫자 범위를 가진 150개의 상관관계가 있는 특성으로 구성된 테이블 형식 데이터셋이 있으며, 회귀 모델을 훈련하기 전에 모델 성능에 미치는 영향을 최소화하면서 차원을 축소해야 합니다. 이 목표를 달성하는 전처리 접근 방식은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: SageMaker Data Wrangler에서 데이터를 열고, Min-Max 스케일러로 특성 스케일을 조정한 다음, 스케일 조정된 데이터에 SageMaker의 내장 PCA를 적용합니다..
이것이 정답인 이유
정답은 SageMaker Data Wrangler에서 데이터를 열고, Min-Max 스케일러로 특성 스케일을 조정한 다음, 스케일 조정된 데이터에 SageMaker의 내장 PCA를 적용하는 것입니다. PCA는 특성 간의 분산을 기반으로 차원을 축소하므로, 서로 다른 숫자 범위를 가진 특성들은 스케일링되지 않으면 분산에 불균형을 초래하여 PCA 결과가 왜곡될 수 있습니다. Min-Max 스케일러는 모든 특성을 0과 1 사이의 동일한 범위로 조정하여 이 문제를 해결합니다. SageMaker Data Wrangler는 이러한 전처리 단계를 쉽게 수행할 수 있는 도구입니다. 원시 데이터에 직접 PCA를 적용하면 스케일 불균형으로 인해 최적의 결과를 얻기 어렵습니다. 상관관계가 높거나 낮은 특성을 제거하는 것은 정보 손실을 야기할 수 있으며, PCA의 목적은 특성 제거가 아닌 차원 축소입니다. Standard Scaler도 스케일링 방법이지만, Min-Max 스케일러가 특정 범위로 정규화하여 PCA에 더 적합할 수 있습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음