데이터 과학자가 S3에 JSON으로 저장된 블로그 게시물에 태그를 추천하기 위해 SageMaker Neural Topic Model(NTM)을 사용했습니다. 모델은 "a", "an", "the"와 같은 불용어(stopwords)와 때로는 드물지만 유효한 단어를 제안합니다. 팀은 드문 단어는 유지하되 불용어는 추천되지 않도록 하려고 합니다. 데이터 과학자는 무엇을 해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: scikit-learn의 CountVectorizer를 사용하여 블로그 텍스트에서 불용어를 제거하고 S3의 데이터를 벡터화된 결과로 교체합니다..
이것이 정답인 이유
SageMaker NTM은 텍스트에서 토픽을 추출하는 데 사용되지만, 불용어는 토픽 모델링에 방해가 될 수 있습니다. CountVectorizer는 텍스트를 단어 빈도 벡터로 변환하는 데 사용되며, 이 과정에서 불용어 목록을 제공하여 불용어를 제거할 수 있습니다. 불용어를 제거한 후 데이터를 NTM에 입력하면 모델이 더 의미 있는 태그를 추천할 수 있습니다. 다른 옵션들은 적절하지 않습니다. Amazon Comprehend 개체 인식은 불용어 제거가 아닌 개체 감지에 중점을 둡니다. SageMaker PCA는 차원 축소 알고리즘으로, 불용어 제거와는 관련이 없습니다. SageMaker Object Detection은 이미지 내 객체 감지에 사용되는 알고리즘으로, 텍스트 태그 추천과는 무관합니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음