EduLogic, üretim ortamına almadan önce iki Bedrock modelini yanıt doğruluğu ve güvenliği açısından karşılaştırmak istiyor. Büyük ölçekte otomatik, tekrarlanabilir metrikler çalıştırmaları ve ayrıca uç durumlar için insan yargılarını toplamaları gerekiyor. Hem yerleşik metriklerle otomatik değerlendirmeyi hem de örneklenmiş çıktılar için insan değerlendirmesini en iyi şekilde uygulayan mimari hangisidir?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Bedrock'ta (veya Bedrock evaluation API'sinde) etiketli bir test kümesi (giriş/referans çiftleri içeren JSONL) üzerinde modelleri çalıştıran ve yerleşik metrikleri (BLEU/ROUGE/F1, güvenlik puanları) hesaplayan otomatik bir değerlendirme işi oluşturun. Değerlendirme yapıtlarını ve metrik raporlarını S3'e kaydedin. İnsan değerlendirmesi için, model çıktılarının katmanlı bir alt kümesini örnekleyin ve insan yargılarını toplamak için özel bir etiketleme kullanıcı arayüzü ile bir SageMaker Ground Truth etiketleme işi (veya Amazon A2I kullanın) oluşturun; nihai model seçimi için insan etiketlerini otomatik metriklerle birleştirin..
Neden bu cevap
Bu mimari, hem otomatik metrikleri hem de insan değerlendirmesini birleştirerek kapsamlı bir model karşılaştırması sağlar. Bedrock değerlendirme API'si, etiketli bir test kümesi üzerinde BLEU, ROUGE, F1 ve güvenlik puanları gibi yerleşik metrikleri otomatik olarak hesaplayarak büyük ölçekli ve tekrarlanabilir değerlendirme ihtiyacını karşılar. Değerlendirme sonuçlarının S3'e kaydedilmesi, izlenebilirlik ve analiz için önemlidir. İnsan değerlendirmesi için, SageMaker Ground Truth veya Amazon A2I ile özel bir etiketleme kullanıcı arayüzü kullanmak, uç durumlar için insan yargılarını toplamanın en etkili yoludur. Bu iki yaklaşımın birleştirilmesi, model seçimi için dengeli ve güvenilir bir temel oluşturur. Diğer seçenekler: Gerçek zamanlı olarak tüm veri kümesine karşı çalıştırmak ve CloudWatch Logs metriklerine güvenmek, büyük ölçekli değerlendirme için uygun değildir ve insan geri bildirimini manuel olarak birleştirmek verimsizdir. SageMaker Model Monitor, üretim sonrası izleme için tasarlanmıştır, üretim öncesi karşılaştırma için değil. Ayrıca, Bedrock'un yerleşik insan inceleme kuyruğu her zaman otomatik olarak tetiklenmez. Yalnızca insan değerlendirmesine güvenmek, maliyetli ve zaman alıcıdır; ayrıca otomatik metriklerin sağladığı nicel analizden yoksun kalır.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez