EduLogic souhaite comparer deux modèles Bedrock en termes de précision des réponses et de sécurité avant d'en déployer un en production. Ils doivent exécuter des métriques automatiques et reproductibles à grande échelle, et également recueillir des jugements humains pour les cas limites. Quelle architecture implémente le mieux à la fois l'évaluation automatisée avec des métriques intégrées et l'évaluation humaine pour les sorties échantillonnées ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Créer une tâche d'évaluation automatisée dans Bedrock (ou l'API d'évaluation Bedrock) qui exécute les modèles sur un jeu de test étiqueté (JSONL avec des paires entrée/référence) et calcule des métriques intégrées (BLEU/ROUGE/F1, scores de sécurité). Persister les artefacts d'évaluation et les rapports de métriques dans S3. Pour l'évaluation humaine, échantillonner un sous-ensemble stratifié des sorties du modèle et créer une tâche d'étiquetage SageMaker Ground Truth (ou utiliser Amazon A2I) avec une interface utilisateur d'étiquetage personnalisée pour recueillir les jugements humains ; combiner les étiquettes humaines avec les métriques automatiques pour la sélection finale du modèle..
Pourquoi c'est la réponse
La bonne réponse combine efficacement l'évaluation automatisée et humaine. L'évaluation automatisée avec Bedrock (ou son API) sur un jeu de test étiqueté permet des métriques reproductibles et à grande échelle (BLEU/ROUGE/F1, scores de sécurité), stockées dans S3 pour l'analyse. Pour les cas limites et les nuances, l'échantillonnage stratifié des sorties et l'utilisation de SageMaker Ground Truth (ou Amazon A2I) avec une interface personnalisée garantissent une évaluation humaine ciblée et de qualité. Les autres options sont moins efficaces : L'exécution en temps réel avec CloudWatch et Lambda est moins adaptée à l'évaluation comparative avant déploiement et la collecte manuelle de retours humains est inefficace. SageMaker Model Monitor est pour la dérive en production, pas pour l'évaluation pré-déploiement, et la "file d'attente de révision humaine intégrée de Bedrock" n'est pas une fonctionnalité standard. Se fier uniquement à l'évaluation humaine via Mechanical Turk pour toutes les sorties est coûteux, lent et ne permet pas une évaluation à grande échelle ni la capture de métriques objectives.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise