Ein Unternehmen führt Echtzeit-Inferenz mit SageMaker aus. Die Auto-Scaling-Funktion für die EC2-Instances, die den Endpunkt unterstützen, startet neue Instances, bevor die vorherigen Scale-out-Instances vollständig bereit sind, was zu Ineffizienzen und Verzögerungen führt. Welche Änderung würde das Skalierungsverhalten verbessern und gleichzeitig die Performance der Antwortzeiten erhalten?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Erhöhen Sie die Cooldown-Periode nach Scale-out-Aktivitäten..
Warum dies die Antwort ist
Das Erhöhen der Cooldown-Periode nach Scale-out-Aktivitäten ist die effektivste Lösung. Eine längere Cooldown-Periode gibt den neu gestarteten EC2-Instances ausreichend Zeit, um vollständig hochzufahren und Anfragen zu verarbeiten, bevor weitere Skalierungsentscheidungen getroffen werden. Dies verhindert das Problem, dass neue Instances gestartet werden, bevor die vorherigen bereit sind, was die Ineffizienzen und Verzögerungen reduziert. Die Umstellung auf eine Multi-Model-Endpunktkonfiguration ist eine Optimierung für die Kosten und die Ressourcennutzung bei vielen kleinen Modellen, löst aber nicht direkt das Problem der langsamen Bereitschaft von Instances. Die Integration von API Gateway und Lambda kann die API-Verwaltung verbessern, beeinflusst aber nicht das Skalierungsverhalten der SageMaker-Instances selbst. Das Verringern der Cooldown-Periode für Scale-in-Aktivitäten oder das Erhöhen der maximalen Instance-Anzahl würde das Problem der unzureichend vorbereiteten Instances nicht beheben und könnte die Situation sogar verschlimmern oder unnötige Kosten verursachen.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich