Ein Data Scientist hat ein Sequenz-zu-Sequenz-Modell für die Englisch-Japanisch-Übersetzung mit 500.000 Satzpaaren trainiert. Kurze Sätze (etwa fünf Wörter) werden gut übersetzt, aber Übersetzungen für sehr lange Sätze (etwa 100 Wörter) sind schlecht. Welche Änderung wird das Problem am ehesten beheben?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Hyperparameter im Zusammenhang mit dem Aufmerksamkeitsmechanismus optimieren..
Warum dies die Antwort ist
Die Optimierung von Hyperparametern des Aufmerksamkeitsmechanismus ist die wahrscheinlichste Lösung. Der Aufmerksamkeitsmechanismus ermöglicht es dem Modell, sich auf relevante Teile des Eingabesatzes zu konzentrieren, wenn es den Ausgabesatz generiert. Bei langen Sätzen kann die Fähigkeit des Modells, die Abhängigkeiten über große Distanzen zu erfassen, ohne einen gut abgestimmten Aufmerksamkeitsmechanismus abnehmen, was zu schlechten Übersetzungen führt. Das Vorverarbeiten von Text in n-Gramme würde die Sequenzlänge nicht direkt adressieren und könnte sogar den Kontext für das Modell reduzieren. Das Erhöhen der Anzahl der RNN-Einheiten, um der Wortanzahl des längsten Satzes zu entsprechen, ist keine übliche oder effektive Methode zur Behebung dieses Problems; die Anzahl der Einheiten ist eher eine Kapazitätsfrage als eine Längenfrage. Ein anderes Gewichtungsinitialisierungsschema würde wahrscheinlich keine signifikante Verbesserung bei der Handhabung langer Sequenzen bewirken, da dies ein Problem der Modellarchitektur und des Trainings ist, nicht der Startbedingungen.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich