Specjalista ds. danych wytrenował model sekwencja-do-sekwencji do tłumaczenia z angielskiego na japoński, używając 500 000 par zdań. Krótkie zdania (około pięciu słów) są tłumaczone dobrze, ale tłumaczenia bardzo długich zdań (około 100 słów) są słabe. Jaka zmiana najprawdopodobniej rozwiąże ten problem?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Dostrajanie hiperparametrów związanych z mechanizmem uwagi (attention mechanism)..
Dlaczego to jest odpowiedź
Model sekwencja-do-sekwencji ma trudności z długimi zdaniami, ponieważ tradycyjne kodery-dekodery RNN mają tendencję do kompresowania wszystkich informacji wejściowych w wektor kontekstowy o stałej długości, co prowadzi do utraty informacji dla dłuższych sekwencji. Mechanizm uwagi (attention mechanism) rozwiązuje ten problem, pozwalając dekoderowi na dostęp do wszystkich stanów ukrytych kodera, co umożliwia mu skupienie się na odpowiednich częściach zdania wejściowego podczas generowania każdego słowa wyjściowego. Dostrajanie hiperparametrów uwagi, takich jak jej typ (np. addytywna, multiplikatywna) lub rozmiar, może znacząco poprawić zdolność modelu do obsługi długich sekwencji. Wstępne przetwarzanie tekstu na n-gramy nie rozwiązuje problemu utraty informacji w długich sekwencjach. Zwiększenie liczby jednostek RNN nie jest bezpośrednio związane z problemem zapominania długoterminowego. Użycie innego schematu inicjalizacji wag jest mniej prawdopodobne, aby rozwiązać ten konkretny problem.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana