Welke evaluatiestatistiek wordt vaak gebruikt om foundation models (FM's) te beoordelen op taken voor tekstsamenvatting?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Bilingual Evaluation Understudy (BLEU) score.
Waarom dit het antwoord is
De BLEU-score (Bilingual Evaluation Understudy) is een veelgebruikte metriek voor het evalueren van de kwaliteit van machinaal gegenereerde tekst ten opzichte van een of meer referentieteksten. Bij tekstsamenvatting vergelijkt BLEU de gegenereerde samenvatting met menselijke samenvattingen, waarbij wordt gekeken naar de overlap van n-grammen (opeenvolgende woorden). Een hogere BLEU-score duidt op een grotere overeenkomst en dus een betere kwaliteit van de samenvatting. De F1-score is een harmonisch gemiddelde van precisie en recall, vaak gebruikt voor classificatietaken. Nauwkeurigheid (Accuracy) is ook een classificatiemetriek die het percentage correcte voorspellingen meet. MSE (Mean Squared Error) wordt gebruikt voor regressietaken, waarbij het de gemiddelde gekwadrateerde verschillen tussen voorspelde en werkelijke waarden meet. Deze drie zijn niet primair ontworpen voor de evaluatie van tekstgeneratie of -samenvatting.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig