데이터 과학자는 차트와 워드 클라우드를 사용하여 고객 의견에 대한 초기 탐색적 분석을 수행해야 하며, NLP 모델을 구축하기 전에 특징 엔지니어링을 적용하려고 합니다. 시각화 및 모델링을 위한 텍스트를 준비하는 데 사용해야 하는 두 가지 특징 엔지니어링 기술은 무엇입니까? (두 가지 선택)
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: Stemming, Term frequency–inverse document frequency (TF‑IDF).
이것이 정답인 이유
스테밍(Stemming)은 단어의 어미나 접사를 제거하여 단어를 기본 형태로 줄이는 과정입니다. 이는 'running', 'ran', 'runs'와 같은 단어를 'run'으로 통일하여 분석의 일관성을 높이고, 워드 클라우드와 같은 시각화에서 중복을 줄이는 데 유용합니다. TF-IDF(Term Frequency-Inverse Document Frequency)는 문서 집합 내에서 단어의 중요도를 측정하는 통계적 척도입니다. 이는 특정 단어가 문서 내에서 얼마나 자주 나타나는지(TF)와 전체 문서 집합에서 얼마나 희귀한지(IDF)를 고려하여, 단순히 자주 나타나는 불용어(예: 'the', 'is')보다 의미 있는 단어에 더 높은 가중치를 부여합니다. 이는 텍스트 데이터를 수치형 벡터로 변환하여 머신러닝 모델의 입력으로 사용하기에 적합합니다. 명명된 개체 인식(Named entity recognition)은 텍스트에서 사람, 장소, 조직과 같은 고유 명사를 식별하는 기술로, 탐색적 분석이나 특징 엔지니어링의 직접적인 준비 단계보다는 더 심층적인 정보 추출에 가깝습니다. 코어퍼런스 해상도(Coreference resolution)는 텍스트 내에서 동일한 개체를 참조하는 모든 표현(예: 대명사)을 식별하는 기술로, 문맥 이해를 돕지만 초기 시각화나 특징 엔지니어링의 필수 단계는 아닙니다. 감성 분석(Sentiment analysis)은 텍스트의 감성(긍정, 부정, 중립)을 파악하는 기술로, 고객 의견 분석의 최종 목표 중 하나일 수 있지만, 텍스트를 모델링을 위해 준비하는 특징 엔지니어링 기술 자체는 아닙니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음