FinInsights a déployé un endpoint de modèle de fondation JumpStart pour la génération de texte financier à faible latence sur une instance ml.g5.xlarge. Après un pilote réussi, ils ont besoin d'un débit soutenu 3 fois plus élevé avec un comportement de latence similaire. Quel est le changement le plus direct et le plus pris en charge pour l'endpoint SageMaker JumpStart afin de répondre à cette exigence ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Mettre à jour la configuration de l'endpoint SageMaker pour utiliser un type d'instance GPU plus grand (par exemple, ml.g5.12xlarge) ou passer à plusieurs instances ml.g5.xlarge derrière l'endpoint (augmenter le nombre d'instances) et activer l'autoscaling de l'endpoint. Redéployer le modèle en utilisant la même image de conteneur JumpStart et la nouvelle configuration d'endpoint..
Pourquoi c'est la réponse
Pour tripler le débit tout en maintenant une latence similaire, la solution la plus directe et la plus supportée est d'augmenter la capacité de l'endpoint. Cela peut être fait en utilisant une instance GPU plus grande (par exemple, ml.g5.12xlarge) qui offre plus de ressources de calcul, ou en augmentant le nombre d'instances ml.g5.xlarge derrière l'endpoint et en activant l'autoscaling pour gérer la charge. Ces deux approches augmentent la capacité de traitement en parallèle ou par instance. Les autres options sont moins appropriées : L'optimisation des hyperparamètres (HyperParameterTuningJob) est pour améliorer les performances du modèle, pas le débit de l'endpoint. Les accélérateurs Elastic Inference sont conçus pour réduire les coûts et améliorer la latence sur des instances CPU ou des instances GPU plus petites, mais ne sont pas la solution principale pour tripler le débit d'une instance GPU dédiée. SageMaker Serverless Inference est une option viable pour l'autoscaling, mais la migration vers une configuration serverless peut introduire des changements de latence et n'est pas toujours la solution la plus directe pour un modèle JumpStart déjà déployé sur des instances dédiées, surtout si le contrôle précis des types d'instances est souhaité.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise