Ein Unternehmen hostet mehrere SageMaker-Modelle in Echtzeit, die beschleunigte Instanzen erfordern und unterschiedliche Skalierungsanforderungen haben. Kaltstarts müssen für jedes Modell verhindert werden. Welches Design erfüllt diese Anforderungen?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Erstellen Sie einen SageMaker-Endpunkt, fügen Sie für jedes Modell eine Inferenzkomponente hinzu, die auf diesen Endpunkt verweist, konfigurieren Sie Auto-Scaling pro Inferenzkomponente und setzen Sie die Mindestanzahl der Kopien auf mindestens 1..
Warum dies die Antwort ist
Die korrekte Lösung ist die Verwendung von SageMaker Inference Components. Diese ermöglichen es, mehrere Modelle auf einem einzigen SageMaker-Endpunkt zu hosten, wobei jedes Modell seine eigenen Skalierungsanforderungen und beschleunigten Instanzen nutzen kann. Durch die Konfiguration von Auto Scaling pro Inferenzkomponente mit einer Mindestanzahl von 1 Instanz pro Komponente werden Kaltstarts für jedes Modell verhindert. SageMaker Serverless Inference ist nicht geeignet, da es keine beschleunigten Instanzen unterstützt und Kaltstarts nicht zuverlässig verhindert werden können. Asynchronous Inference ist für Batch-Verarbeitung gedacht, nicht für Echtzeit-Inferenz. Ein Multi-Model-Endpunkt ist für das Hosten vieler Modelle auf denselben Instanzen gedacht, was bei unterschiedlichen Skalierungs- und Instanzanforderungen ineffizient wäre und Kaltstarts nicht pro Modell verhindert.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich