Uma empresa está treinando um modelo de linguagem grande personalizado para um chatbot voltado para adolescentes. O chatbot deve usar o estilo informal do público, incluindo grafias criativas e abreviações. Qual métrica é apropriada para avaliar o desempenho do modelo?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: BERTScore.
Por que esta é a resposta
BERTScore é a métrica mais apropriada porque avalia a qualidade do texto gerado com base na similaridade contextual das palavras, utilizando embeddings de modelos de linguagem pré-treinados (como BERT). Isso permite que o BERTScore capture nuances de significado e estilo, o que é crucial para avaliar se o chatbot está gerando texto que soa natural e informal para adolescentes, incluindo grafias criativas e abreviações. F1 score é uma métrica de classificação que mede a precisão e o recall, inadequada para avaliação de geração de texto. ROUGE e BLEU score são métricas baseadas em sobreposição de n-gramas, que penalizariam grafias criativas e abreviações não presentes no texto de referência, sendo menos eficazes para capturar a fluidez e o estilo informal desejados.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão