Uma empresa construiu um modelo de sumarização de texto generativo com o Amazon Bedrock e quer usar a avaliação automática de modelo do Bedrock para medir a precisão do modelo. Qual métrica de avaliação é a mais apropriada para avaliar a qualidade dos resumos gerados?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: BERTScore.
Por que esta é a resposta
BERTScore é a métrica mais apropriada porque compara a similaridade semântica entre os resumos gerados e os resumos de referência usando embeddings de linguagem contextual. Isso é crucial para modelos generativos, onde a correspondência exata de palavras (como no F1 score) pode não capturar a qualidade do resumo. AUC é usado para classificação binária e mede a capacidade de um modelo de distinguir entre classes, o que não se aplica à sumarização. O F1 score mede a precisão e o recall de correspondências de tokens, sendo mais adequado para tarefas como extração de entidades ou classificação de texto, não para a qualidade semântica de um resumo gerativo. O Real World Knowledge (RWK) score não é uma métrica padrão de avaliação de modelos generativos no Amazon Bedrock.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão