한 데이터 과학자가 500,000개의 문장 쌍을 사용하여 영어-일본어 번역을 위한 sequence-to-sequence 모델을 훈련했습니다. 짧은 문장(약 5단어)은 번역이 잘 되지만, 매우 긴 문장(약 100단어)의 번역은 좋지 않습니다. 어떤 변경 사항이 이 문제를 해결할 가능성이 가장 높을까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 어텐션 메커니즘과 관련된 하이퍼파라미터를 튜닝합니다..
이것이 정답인 이유
긴 문장의 번역 품질이 낮은 것은 시퀀스-투-시퀀스 모델이 입력 시퀀스의 모든 부분을 효과적으로 인코딩하고 디코딩하는 데 어려움을 겪기 때문일 수 있습니다. 어텐션 메커니즘은 모델이 번역 시 입력 시퀀스의 관련 부분에 집중할 수 있도록 하여 이 문제를 완화합니다. 어텐션 관련 하이퍼파라미터를 튜닝하면 모델이 긴 시퀀스에서 중요한 정보를 더 잘 포착하고 유지할 수 있어 번역 품질이 향상될 수 있습니다. n-gram 전처리는 문맥 정보를 잃게 하여 성능을 저하시킬 수 있습니다. RNN 유닛 수를 늘리는 것은 모델 용량을 늘리지만, 어텐션 메커니즘 없이는 긴 문장 의존성 문제를 해결하지 못합니다. 다른 가중치 초기화 방식은 훈련 안정성에 영향을 줄 수 있지만, 긴 시퀀스 번역의 근본적인 어려움을 직접적으로 해결하지는 못합니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음