Word2Vec 임베딩(예: "The quck BROWN FOX jumps over the lazy dog")을 위해 100만 개의 문장을 준비하려면 텍스트를 일관되게 정리하고 준비하기 위해 어떤 작업을 적용해야 할까요? (세 가지 선택)
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 모든 문자를 소문자로 변환하여 정규화합니다., 영어 불용어 목록을 사용하여 불용어를 제거합니다., 각 문장을 개별 단어로 토큰화합니다..
이것이 정답인 이유
Word2Vec 임베딩을 위한 텍스트 준비에는 일관성과 효율성이 중요합니다. 1. 모든 문자를 소문자로 변환하여 정규화합니다. 이는 "Brown"과 "brown"을 같은 단어로 처리하여 단어 임베딩의 일관성을 높이고 어휘 크기를 줄이는 데 필수적입니다. 2. 영어 불용어 목록을 사용하여 불용어를 제거합니다. "the", "is", "a"와 같은 불용어는 문법적 기능은 있지만 의미론적 가치는 낮아 Word2Vec 모델의 학습을 방해할 수 있으므로 제거하는 것이 좋습니다. 3. 각 문장을 개별 단어로 토큰화합니다. Word2Vec은 단어 수준에서 작동하므로, 텍스트를 개별 단어(토큰)로 분리하는 것이 첫 번째 단계입니다. 품사 태깅은 Word2Vec에 필수적이지 않으며, 철자 오류 수정은 도움이 될 수 있지만 대규모 데이터셋에서는 비실용적일 수 있습니다. 원-핫 인코딩은 Word2Vec의 입력이 아닌 출력과 관련된 다른 임베딩 방식입니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음