Een app voor het leren van talen gebruikt een LLM om tekst te herschrijven zodat deze beter leesbaar is. De trainingsdataset bevat originele tekst gekoppeld aan beter leesbare versies, en het bedrijf wil dat de outputs overeenkomen met die voorbeelden. Welke metriek moeten ze gebruiken om te evalueren hoe nauwkeurig de outputs van het model overeenkomen met de referentieherschrijvingen?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: ROUGE (Recall-Oriented Understudy for Gisting Evaluation) score.
Waarom dit het antwoord is
ROUGE (Recall-Oriented Understudy for Gisting Evaluation) is een set van metrics die worden gebruikt om de kwaliteit van samenvattingen of gegenereerde tekst te evalueren door deze te vergelijken met een of meer referentieteksten. In dit scenario, waar de app de gegenereerde tekst wil vergelijken met vooraf gedefinieerde, beter leesbare versies, is ROUGE de meest geschikte metriek. De loss function waarde is een interne trainingsmetriek en geen directe evaluatie van de outputkwaliteit. Semantische robuustheid meet hoe goed het model presteert bij kleine verstoringen in de input, niet de overeenkomst met referentieteksten. Text-generation latency meet de snelheid van het model, niet de nauwkeurigheid van de gegenereerde inhoud.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig