A EduLogic deseja comparar dois modelos Bedrock quanto à precisão e segurança das respostas antes de colocar um em produção. Eles precisam executar métricas automáticas e repetíveis em escala e também coletar julgamentos humanos para casos extremos. Qual arquitetura melhor implementa a avaliação automatizada com métricas integradas e a avaliação humana para saídas amostradas?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Crie um trabalho de avaliação automatizada no Bedrock (ou a API de avaliação do Bedrock) que execute os modelos em um conjunto de testes rotulado (JSONL com pares de entrada/referência) e calcule métricas integradas (BLEU/ROUGE/F1, pontuações de segurança). Persista os artefatos de avaliação e os relatórios de métricas no S3. Para avaliação humana, amostre um subconjunto estratificado das saídas do modelo e crie um trabalho de rotulagem do SageMaker Ground Truth (ou use o Amazon A2I) com uma UI de rotulagem personalizada para coletar julgamentos humanos; combine os rótulos humanos com métricas automáticas para a seleção final do modelo..
Por que esta é a resposta
A opção correta descreve a abordagem mais completa e escalável para avaliação de modelos no Bedrock. Ela integra a avaliação automatizada do Bedrock para métricas de desempenho e segurança em escala, usando um conjunto de testes rotulado e persistindo os resultados no S3. Para casos extremos e nuances humanas, ela emprega o SageMaker Ground Truth ou Amazon A2I, que são serviços robustos para rotulagem humana em larga escala com UIs personalizadas. As opções incorretas são falhas porque: Confiar apenas em logs do CloudWatch e funções Lambda para métricas de precisão e segurança é ineficiente e não padronizado para avaliação de LLMs. Usar um formulário web público e mesclar resultados manualmente é inviável em escala. O SageMaker Model Monitor é para monitoramento de modelos em produção, não para avaliação comparativa pré-produção. A "fila de revisão humana integrada do Bedrock que o Bedrock criará automaticamente" não é um recurso padrão do Bedrock. Depender exclusivamente de avaliação humana para todas as saídas é extremamente caro, demorado e não escalável, especialmente para modelos que geram grandes volumes de texto. Ignorar métricas automáticas descarta dados valiosos e objetivos.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão