Um aplicativo de aprendizado de idiomas usa um LLM para reescrever textos e torná-los mais legíveis. O conjunto de dados de treinamento inclui o texto original emparelhado com versões mais legíveis, e a empresa quer que as saídas correspondam a esses exemplos. Qual métrica eles devem usar para avaliar o quão de perto as saídas do modelo correspondem às reescritas de referência?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Pontuação ROUGE (Recall-Oriented Understudy for Gisting Evaluation).
Por que esta é a resposta
A pontuação ROUGE é a métrica mais apropriada para avaliar a similaridade entre o texto gerado pelo modelo e o texto de referência (reescritas mais legíveis). Ela mede a sobreposição de n-gramas, sequências de palavras e pares de palavras entre os dois textos, sendo comumente usada para tarefas de sumarização e geração de texto onde a correspondência com uma referência é crucial. A função de perda (loss function) é usada durante o treinamento para otimizar o modelo, não para avaliar a qualidade da saída final em relação a uma referência. A robustez semântica avalia a capacidade do modelo de manter o significado apesar de pequenas perturbações na entrada, o que não é o foco aqui. A latência de geração de texto mede o tempo que o modelo leva para produzir uma saída, sendo uma métrica de desempenho e não de qualidade da reescrita.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão