Ein Unternehmen trainiert ein benutzerdefiniertes großes Sprachmodell für einen Chatbot, der sich an Teenager richtet. Der Chatbot soll den informellen Stil der Zielgruppe verwenden, einschließlich kreativer Schreibweisen und Abkürzungen. Welche Metrik ist zur Bewertung der Leistung des Modells geeignet?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: BERTScore.
Warum dies die Antwort ist
BERTScore ist die am besten geeignete Metrik, da es die semantische Ähnlichkeit zwischen generiertem und Referenztext bewertet, indem es kontextualisierte Einbettungen (wie BERT) verwendet. Dies ist entscheidend für die Bewertung von informeller Sprache mit kreativen Schreibweisen und Abkürzungen, da es die Bedeutung erfasst, auch wenn die genaue Wortübereinstimmung gering ist. BLEU und ROUGE basieren hauptsächlich auf N-Gramm-Überlappung und sind daher weniger effektiv bei der Bewertung von Texten, die stark von Referenztexten abweichen, aber semantisch korrekt sind, wie es bei informeller Sprache der Fall ist. Der F1-Score ist eine allgemeine Metrik, die Präzision und Recall kombiniert, aber in diesem Kontext nicht spezifisch genug für die Bewertung der Sprachgenerierung ist, insbesondere bei der Berücksichtigung von semantischer Ähnlichkeit über exakte Übereinstimmungen hinaus.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich