Een data scientist heeft een sequence-to-sequence model getraind voor Engels→Japans vertaling met behulp van 500.000 zinnenparen. Korte zinnen (ongeveer vijf woorden) worden goed vertaald, maar vertalingen voor zeer lange zinnen (ongeveer 100 woorden) zijn slecht. Welke verandering zal het probleem hoogstwaarschijnlijk oplossen?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Hyperparameters afstemmen die gerelateerd zijn aan het attention-mechanisme..
Waarom dit het antwoord is
De slechte prestaties bij lange zinnen duiden op een probleem met het vasthouden van informatie over lange afstanden, wat een bekend probleem is bij traditionele sequence-to-sequence modellen zonder attention. Het attention-mechanisme helpt het model om relevante delen van de invoerzin te focussen bij het genereren van elk uitvoerwoord, wat cruciaal is voor lange zinnen. Het afstemmen van hyperparameters van het attention-mechanisme, zoals het type attention (bijv. additief of multiplicatief) of de grootte van de attention-vector, kan de effectiviteit ervan aanzienlijk verbeteren. Het voorbewerken tot n-grammen verandert de invoerrepresentatie, maar lost het onderliggende geheugenprobleem van het model niet op. Het verhogen van het aantal RNN-eenheden kan leiden tot overfitting en hogere computationele kosten zonder noodzakelijkerwijs het langeafstandsgeheugen te verbeteren. Een ander gewichtsinitialisatieschema heeft meestal een beperkte impact op dit specifieke probleem; het helpt voornamelijk bij het convergeren van het model, niet bij het oplossen van structurele beperkingen met lange sequenties.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig