Uma empresa deseja realizar inferência em dispositivos de borda com a menor latência possível usando modelos de linguagem. Qual abordagem de implantação melhor atinge esse objetivo?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Implantar modelos de linguagem pequenos (SLMs) otimizados diretamente nos dispositivos de borda.
Por que esta é a resposta
A implantação de Modelos de Linguagem Pequenos (SLMs) otimizados diretamente nos dispositivos de borda é a melhor abordagem para menor latência. SLMs são projetados para serem mais eficientes em termos de computação e memória, tornando-os ideais para ambientes de borda com recursos limitados. A execução direta no dispositivo elimina a necessidade de comunicação de rede, que é a principal causa de latência em cenários de inferência. Modelos de Linguagem Grandes (LLMs) são muito grandes e exigem recursos computacionais significativos, tornando-os inadequados para a maioria dos dispositivos de borda, mesmo quando otimizados. O uso de APIs centralizadas, sejam para SLMs ou LLMs, introduz latência de rede inevitável, pois os dispositivos de borda precisam enviar dados para um servidor remoto e aguardar a resposta. Chamadas assíncronas podem ajudar a gerenciar a carga, mas não reduzem a latência individual de cada inferência.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão