EduLogic quiere comparar dos modelos de Bedrock en cuanto a la precisión y seguridad de las respuestas antes de implementar uno en producción. Necesitan ejecutar métricas automáticas y repetibles a escala, y también recopilar juicios humanos para casos excepcionales. ¿Qué arquitectura implementa mejor tanto la evaluación automatizada con métricas integradas como la evaluación humana para salidas muestreadas?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Cree un trabajo de evaluación automatizado en Bedrock (o la API de evaluación de Bedrock) que ejecute los modelos en un conjunto de pruebas etiquetado (JSONL con pares de entrada/referencia) y calcule métricas integradas (BLEU/ROUGE/F1, puntuaciones de seguridad). Persista los artefactos de evaluación y los informes de métricas en S3. Para la evaluación humana, muestree un subconjunto estratificado de las salidas del modelo y cree un trabajo de etiquetado de SageMaker Ground Truth (o use Amazon A2I) con una interfaz de usuario de etiquetado personalizada para recopilar juicios humanos; combine las etiquetas humanas con las métricas automáticas para la selección final del modelo..
Por qué esta es la respuesta
La opción correcta describe una arquitectura que integra la evaluación automatizada y la evaluación humana, lo cual es esencial para una evaluación exhaustiva del modelo. La evaluación automatizada con Bedrock (o su API) utilizando un conjunto de pruebas etiquetado y métricas integradas (BLEU/ROUGE/F1, seguridad) permite una evaluación escalable y repetible. Almacenar los resultados en S3 garantiza la persistencia. La evaluación humana mediante SageMaker Ground Truth o Amazon A2I para un subconjunto muestreado de salidas aborda casos excepcionales y matices que las métricas automáticas podrían pasar por alto. Las opciones incorrectas son deficientes porque: La opción de CloudWatch Logs y Lambda es ineficiente para métricas complejas y el formulario web público es una forma manual y no escalable de recopilar comentarios humanos. SageMaker Model Monitor está diseñado para la monitorización de modelos en producción, no para la evaluación comparativa inicial, y Bedrock no crea automáticamente una cola de revisión humana. Confiar únicamente en la evaluación humana a través de Mechanical Turk para todas las salidas es costoso, lento y no escalable, y descarta los beneficios de la evaluación automatizada.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta