Regressieprobleem in NLP met 100M gelabelde voorbeelden; data willekeurig geschud en gesplitst 90/10 train/test. De train RMSE is twee keer zo hoog als de test RMSE. Hoe kun je de modelprestaties verbeteren?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Verhoog de complexiteit van je model door bijvoorbeeld een extra laag te introduceren of de grootte van gebruikte vocabulaires of n-grammen te vergroten..
Waarom dit het antwoord is
De situatie, waarbij de trainings-RMSE significant hoger is dan de test-RMSE, duidt op underfitting. Dit betekent dat het model te eenvoudig is om de onderliggende patronen in de trainingsdata te leren. Het verhogen van de complexiteit van het model, bijvoorbeeld door extra lagen toe te voegen aan een neuraal netwerk of de representatie van tekst (vocabulaire, n-grammen) te vergroten, stelt het model in staat om complexere relaties te modelleren en de trainingsdata beter te leren. Het verhogen van de test-sample is irrelevant voor underfitting. Meer data verzamelen is nuttig bij overfitting of als de dataset te klein is, maar niet bij underfitting met 100M voorbeelden. Regularisatietechnieken zijn bedoeld om overfitting tegen te gaan, niet underfitting.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig