EduLogic möchte zwei Bedrock-Modelle hinsichtlich der Antwortgenauigkeit und Sicherheit vergleichen, bevor eines davon in Produktion geht. Sie müssen automatische, wiederholbare Metriken in großem Maßstab ausführen und auch menschliche Beurteilungen für Grenzfälle sammeln. Welche Architektur implementiert am besten sowohl die automatisierte Bewertung mit integrierten Metriken als auch die menschliche Bewertung für Stichproben von Ausgaben?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Erstellen Sie einen automatisierten Bewertungsjob in Bedrock (oder der Bedrock-Evaluierungs-API), der die Modelle auf einem beschrifteten Testsatz (JSONL mit Eingabe-/Referenzpaaren) ausführt und integrierte Metriken (BLEU/ROUGE/F1, Sicherheitsbewertungen) berechnet. Speichern Sie Bewertungsartefakte und Metrikberichte in S3. Für die menschliche Bewertung entnehmen Sie eine geschichtete Untermenge der Modellausgaben und erstellen Sie einen SageMaker Ground Truth-Beschriftungsjob (oder verwenden Sie Amazon A2I) mit einer benutzerdefinierten Beschriftungs-UI, um menschliche Beurteilungen zu sammeln; kombinieren Sie menschliche Beschriftungen mit automatischen Metriken für die endgültige Modellauswahl..
Warum dies die Antwort ist
Die korrekte Antwort kombiniert die Stärken automatischer und menschlicher Bewertung. Bedrock bietet integrierte Bewertungsfunktionen und Metriken (BLEU/ROUGE/F1, Sicherheitsbewertungen) für eine skalierbare, wiederholbare Bewertung auf einem beschrifteten Datensatz. Dies ist effizient für große Datenmengen. Für Grenzfälle oder komplexe Nuancen, die automatische Metriken möglicherweise nicht erfassen, ermöglicht die Entnahme einer Stichprobe und die Verwendung von SageMaker Ground Truth oder Amazon A2I die Einbeziehung menschlicher Gutachter. Diese Tools sind speziell für die Sammlung menschlicher Anmerkungen konzipiert und ermöglichen eine benutzerdefinierte UI. Die Kombination beider Ansätze führt zu einer robusten und umfassenden Modellbewertung. Die Option mit CloudWatch Logs und Lambda ist weniger geeignet, da sie keine integrierten LLM-spezifischen Metriken bietet und die manuelle Zusammenführung von Feedback ineffizient ist. SageMaker Model Monitor ist für die Überwachung von Modellen in Produktion gedacht, nicht für die Vorab-Bewertung. Die Option, sich ausschließlich auf menschliche Bewertung über Mechanical Turk zu verlassen, ist ineffizient, teuer und nicht skalierbar für große Datensätze und ignoriert die Vorteile automatischer Metriken.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich