Een bedrijf heeft een generatief tekstsamenvattingsmodel gebouwd met Amazon Bedrock en wil de automatische model-evaluatie van Bedrock gebruiken om de nauwkeurigheid van het model te meten. Welke evaluatiestatistiek is het meest geschikt voor het beoordelen van de kwaliteit van gegenereerde samenvattingen?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: BERTScore.
Waarom dit het antwoord is
BERTScore is het meest geschikt voor het evalueren van de kwaliteit van gegenereerde samenvattingen omdat het de semantische gelijkenis tussen de gegenereerde samenvatting en de referentietekst meet, rekening houdend met de context van woorden. Dit is cruciaal voor samenvattingstaken waarbij de woordkeuze kan variëren, maar de betekenis behouden moet blijven. AUC (Area Under the ROC Curve) is primair voor classificatietaken en meet de prestaties van een binair classificatiemodel, niet de kwaliteit van gegenereerde tekst. De F1-score is ook een classificatiestatistiek die precisie en recall combineert, maar is minder geschikt voor open-ended tekstgeneratie. RWK (Real World Knowledge) score is geen standaard evaluatiestatistiek binnen Amazon Bedrock voor model-evaluatie van samenvattingen.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig