Une entreprise souhaite effectuer de l'inférence sur des appareils périphériques avec la latence la plus faible possible en utilisant des modèles linguistiques. Quelle approche de déploiement permet d'atteindre cet objectif au mieux ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Déployer des modèles linguistiques optimisés de petite taille (SLM) directement sur les appareils périphériques.
Pourquoi c'est la réponse
Déployer des modèles linguistiques optimisés de petite taille (SLM) directement sur les appareils périphériques est la meilleure approche pour une faible latence. Les SLM sont conçus pour être efficaces en termes de calcul et de mémoire, ce qui les rend adaptés à l'exécution directe sur le matériel périphérique. Cette exécution locale élimine le besoin de communication réseau, réduisant ainsi considérablement la latence. Les LLM, qu'ils soient déployés localement ou via une API, sont trop grands et complexes pour une inférence à faible latence sur des appareils périphériques. L'utilisation d'une API centralisée, qu'elle soit pour des SLM ou des LLM, introduirait une latence réseau inévitable, ce qui contredit l'objectif principal.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise