Une entreprise de médias a besoin de recommandations d'articles à faible latence pour les lecteurs d'une ville. Le trafic atteint des pics à des moments prévisibles (matin, déjeuner, après le travail) et est faible le reste du temps. Les réponses d'inférence sont inférieures à 4 Mo. Quelle option de déploiement minimise la latence et est la plus rentable ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Inférence serverless avec concurrence provisionnée pour minimiser la latence de démarrage à froid..
Pourquoi c'est la réponse
L'inférence serverless avec concurrence provisionnée est la solution la plus rentable et à faible latence. Elle permet une mise à l'échelle automatique pour gérer les pics de trafic sans provisionner des ressources excessives, et la concurrence provisionnée élimine les démarrages à froid, assurant une faible latence constante. Les points de terminaison d'inférence en temps réel avec mise à l'échelle automatique sont une option viable mais potentiellement plus coûteuse en raison de la facturation par instance. L'inférence asynchrone et les tâches de transformation par lots introduisent une latence inacceptable pour des recommandations en temps réel, car elles traitent les requêtes en différé.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise