Eine Sprachlern-App verwendet ein LLM, um Texte umschreiben zu lassen, damit sie besser lesbar sind. Der Trainingsdatensatz enthält Originaltexte, die mit besser lesbaren Versionen gepaart sind, und das Unternehmen möchte, dass die Ausgaben diesen Beispielen entsprechen. Welche Metrik sollten sie verwenden, um zu bewerten, wie genau die Ausgaben des Modells mit den Referenzumschreibungen übereinstimmen?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: ROUGE (Recall-Oriented Understudy for Gisting Evaluation) Score.
Warum dies die Antwort ist
ROUGE (Recall-Oriented Understudy for Gisting Evaluation) ist eine Metrik, die häufig zur Bewertung der Qualität von Textzusammenfassungen und -generierungen verwendet wird, indem sie die Überlappung von N-Grammen zwischen der generierten Ausgabe und einer oder mehreren Referenzzusammenfassungen misst. Da das Unternehmen möchte, dass die Umschreibungen des LLM den bereitgestellten Referenzumschreibungen entsprechen, ist ROUGE die am besten geeignete Metrik, um diese Übereinstimmung zu bewerten. Der Wert der Verlustfunktion ist eine interne Metrik, die während des Trainings optimiert wird, aber nicht direkt die Qualität der Ausgabe im Vergleich zu Referenzen misst. Semantische Robustheit bewertet, wie gut das Modell auf kleine Änderungen in den Eingabedaten reagiert, nicht die Übereinstimmung mit Referenztexten. Die Latenz der Textgenerierung misst die Geschwindigkeit der Ausgabe, nicht deren Qualität oder Genauigkeit.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich