Usando o SageMaker Data Wrangler, um engenheiro encontra um recurso categórico de texto com milhares de valores ligeiramente diferentes causados por erros de digitação. Qual método de codificação deve ser usado para que o recurso processado possa ser usado para classificação?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Usar codificação de similaridade para agrupar e representar categorias com grafias semelhantes..
Por que esta é a resposta
A codificação de similaridade é a melhor opção porque o problema descreve milhares de valores "ligeiramente diferentes" devido a "erros de digitação". Este método é projetado especificamente para agrupar e padronizar categorias com grafias semelhantes, o que é crucial para dados ruidosos e inconsistentes. A codificação ordinal atribuiria uma ordem arbitrária, o que não é apropriado para categorias textuais sem uma ordem intrínseca. A codificação one-hot criaria um número excessivo de colunas (uma para cada uma das milhares de categorias distintas), levando à esparsidade e ao aumento da complexidade do modelo. A codificação de destino mapeia categorias para estatísticas do alvo, o que pode ser útil, mas não resolve o problema subjacente de erros de digitação e alta cardinalidade de forma eficaz como a codificação de similaridade.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão