Un modèle de ML va évaluer des clients dans une application en ligne afin de déterminer quel produit leur présenter. L'ingénieur doit minimiser la latence de réponse. Comment le modèle doit-il être déployé dans SageMaker pour répondre aux exigences de faible latence ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Configurer un point de terminaison d'inférence en temps réel..
Pourquoi c'est la réponse
Un point de terminaison d'inférence en temps réel (real-time inference endpoint) est la solution optimale pour les applications nécessitant une faible latence, car il maintient les ressources de calcul provisionnées et prêtes à répondre immédiatement aux requêtes. La transformation par lots (batch transform) est conçue pour traiter de grands volumes de données de manière asynchrone, ce qui introduit une latence inacceptable pour ce cas d'utilisation. Un point de terminaison d'inférence sans serveur (serverless) peut avoir des latences de démarrage à froid (cold start latencies) qui ne sont pas acceptables pour des exigences strictes de faible latence. Un point de terminaison d'inférence asynchrone (asynchronous inference endpoint) est également destiné aux requêtes qui peuvent tolérer un délai de traitement plus long, ce qui n'est pas le cas ici.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise