Ein Medienunternehmen benötigt Artikel-Empfehlungen mit geringer Latenz für Leser in einer Stadt. Der Traffic erreicht Spitzenwerte zu vorhersehbaren Zeiten (morgens, mittags, nach Feierabend) und ist ansonsten gering. Inferenz-Antworten liegen unter 4 MB. Welche Bereitstellungsoption minimiert die Latenz und ist am kostengünstigsten?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Serverless inference mit provisioned concurrency, um die Latenz beim Kaltstart zu minimieren..
Warum dies die Antwort ist
Serverless Inference mit Provisioned Concurrency ist die beste Option, da es die Vorteile von Serverless (kostengünstig bei geringem Traffic) mit der Eliminierung von Kaltstarts (durch Provisioned Concurrency) kombiniert, was für die Spitzenzeiten wichtig ist. Real-time inference endpoints mit Auto Scaling sind teurer, da sie auch bei geringem Traffic ständig Instanzen vorhalten müssen, um die Latenzanforderungen zu erfüllen. Asynchronous inference und Batch transform jobs sind für Echtzeit-Empfehlungen mit geringer Latenz ungeeignet, da sie auf verzögerte Verarbeitung ausgelegt sind und die Benutzer nicht sofort die gewünschten Empfehlungen erhalten würden.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich