EduLogic chce porównać dwa modele Bedrock pod kątem dokładności odpowiedzi i bezpieczeństwa, zanim jeden z nich zostanie wdrożony do produkcji. Muszą uruchomić automatyczne, powtarzalne metryki na dużą skalę, a także zebrać oceny ludzkie dla przypadków brzegowych. Która architektura najlepiej implementuje zarówno automatyczną ewaluację z wbudowanymi metrykami, jak i ewaluację ludzką dla próbkowanych wyników?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Utwórz zautomatyzowane zadanie ewaluacyjne w Bedrock (lub użyj Bedrock evaluation API), które uruchamia modele na oznaczonym zbiorze testowym (JSONL z parami input/reference) i oblicza wbudowane metryki (BLEU/ROUGE/F1, safety scores). Zachowaj artefakty ewaluacyjne i raporty metryk w S3. Do ewaluacji ludzkiej, próbuj stratyfikowaną podgrupę wyników modelu i utwórz zadanie etykietowania SageMaker Ground Truth (lub użyj Amazon A2I) z niestandardowym interfejsem użytkownika do etykietowania, aby zebrać oceny ludzkie; połącz etykiety ludzkie z automatycznymi metrykami w celu ostatecznego wyboru modelu..
Dlaczego to jest odpowiedź
Ta opcja jest najlepsza, ponieważ łączy zautomatyzowaną ewaluację Bedrock z oceną ludzką. Bedrock Evaluation API umożliwia skalowalne, powtarzalne obliczanie wbudowanych metryk (BLEU, ROUGE, F1, bezpieczeństwo) na oznaczonym zbiorze danych, co jest kluczowe dla porównania modeli. Przechowywanie artefaktów w S3 zapewnia trwałość i możliwość audytu. W przypadku oceny ludzkiej, SageMaker Ground Truth lub Amazon A2I z niestandardowym interfejsem użytkownika to standardowe, skalowalne rozwiązania do zbierania wysokiej jakości ocen dla przypadków brzegowych. Połączenie obu metod zapewnia kompleksową i wiarygodną ocenę. Pozostałe opcje są mniej odpowiednie: Używanie CloudWatch Logs i funkcji Lambda do heurystyk jest mniej precyzyjne i skalowalne niż dedykowane narzędzia ewaluacyjne. Publiczny formularz internetowy i ręczne łączenie danych są nieefektywne i podatne na błędy. SageMaker Model Monitor służy do monitorowania modeli w produkcji, a nie do ewaluacji przed wdrożeniem. Wbudowana kolejka recenzji ludzkich Bedrock nie jest domyślnie dostępna w taki sposób. Wyłącznie panel oceny ludzkiej jest kosztowny, czasochłonny i nie zapewnia obiektywnych, skalowalnych metryk, które są niezbędne do porównywania modeli na dużą skalę. Automatyczne metryki są cennym uzupełnieniem, a nie alternatywą.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana