편집자에게는 쿼리된 단어가 문서 코퍼스에서 가장 중요하고 대표적인 문서를 반환하는 검색 도구가 필요합니다. 초기 도구는 일반적인 단어 일치를 반환하며 수동 필터링이 필요합니다. 쿼리된 단어가 가장 중요한 문서를 도구가 강조 표시하도록 문서별 단어 중요도와 빈도를 캡처하는 솔루션은 무엇입요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 문서의 각 단어에 대한 용어 빈도(문서 길이에 따라 가중치 적용)와 코퍼스 전반의 역문서 빈도를 계산하고, 이를 결합(예: 곱하기)하여 최종 관련성 점수를 형성하고, 쿼리된 단어에 대해 점수가 높은 문서를 반환합니다..
이것이 정답인 이유
정답은 TF-IDF(Term Frequency-Inverse Document Frequency)를 설명합니다. TF-IDF는 문서 내 단어의 중요도(TF)와 코퍼스 전체에서 단어의 희귀성(IDF)을 결합하여 특정 단어가 문서에 얼마나 중요한지 측정하는 통계적 척도입니다. 이 방법은 쿼리된 단어가 문서에서 자주 나타나고(높은 TF), 코퍼스 전체에서는 드물게 나타날수록(높은 IDF) 해당 문서가 쿼리에 더 관련성이 높다고 판단하여, 가장 중요하고 대표적인 문서를 반환하는 데 효과적입니다.
LDA는 토픽 모델링에 사용되며, 단어의 중요도보다는 문서의 토픽 분포를 파악하는 데 중점을 둡니다. 사전 훈련된 단어 임베딩은 단어의 의미적 유사성을 포착하지만, 특정 단어가 문서에서 얼마나 중요한지 직접적으로 측정하지는 않습니다. 불용어를 제외한 원시 단어 빈도는 단어의 일반적인 중요성을 고려하지 않아, 흔한 단어가 불필요하게 높은 점수를 받을 수 있습니다.