Welche Bewertungsmetrik wird häufig verwendet, um Foundation Models (FMs) bei Textzusammenfassungsaufgaben zu bewerten?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Bilingual Evaluation Understudy (BLEU) score.
Warum dies die Antwort ist
Der BLEU-Score (Bilingual Evaluation Understudy) ist eine gängige Metrik zur Bewertung der Qualität von maschinell generiertem Text im Vergleich zu einem oder mehreren Referenztexten. Er misst die N-Gramm-Überlappung zwischen dem generierten und dem Referenztext, was ihn besonders geeignet für Aufgaben wie Textzusammenfassung und maschinelle Übersetzung macht. Der F1-Score wird hauptsächlich für Klassifikationsaufgaben verwendet und bewertet Präzision und Recall. Accuracy ist ebenfalls eine Metrik für Klassifikationsaufgaben und misst den Anteil korrekt klassifizierter Instanzen. Der Mean Squared Error (MSE) wird für Regressionsaufgaben eingesetzt, um die durchschnittliche quadratische Differenz zwischen vorhergesagten und tatsächlichen Werten zu quantifizieren.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich