Un modèle déployé basé sur un algorithme génétique peut prendre plusieurs minutes pour produire une prédiction et doit traiter des requêtes pouvant inclure jusqu'à 100 Mo de données. Quelle option de déploiement minimise la surcharge opérationnelle tout en répondant à ces exigences ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Déployer le modèle sur un point de terminaison d'inférence asynchrone Amazon SageMaker..
Pourquoi c'est la réponse
L'inférence asynchrone Amazon SageMaker est la solution optimale car elle est conçue pour les requêtes avec de grandes charges utiles (jusqu'à 1 Go) et des temps de traitement longs (jusqu'à une heure), ce qui correspond aux exigences du modèle. Elle met les requêtes en file d'attente et renvoie des réponses une fois le traitement terminé, minimisant ainsi la surcharge opérationnelle en gérant automatiquement la mise à l'échelle et la gestion des files d'attente. Les points de terminaison en temps réel SageMaker sont mieux adaptés aux inférences à faible latence avec des charges utiles plus petites. Les instances EC2 avec Auto Scaling et ALB nécessitent une gestion manuelle plus importante. Déployer sur Amazon ECS est une option viable mais n'offre pas la même gestion intégrée de la latence et de la taille des charges utiles que l'inférence asynchrone SageMaker.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise