Een bedrijf heeft een getraind ML-model in Amazon SageMaker dat in productie moet worden gehost met hoge beschikbaarheid, minimale latentie en de mogelijkheid om onvoorspelbare pieken in verzoeken af te handelen. Elk verzoek zal tussen 1 KB en 3 MB zijn. De inferentiecapaciteit moet proportioneel met de vraag meeschalen. Hoe moet het bedrijf het model implementeren?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Maak een SageMaker real-time inference endpoint aan, schakel autoscaling in en implementeer het bestaande model naar dat endpoint..
Waarom dit het antwoord is
De beste aanpak is het aanmaken van een SageMaker real-time inference endpoint met autoscaling ingeschakeld. SageMaker real-time endpoints zijn ontworpen voor lage latentie en hoge beschikbaarheid, en de ingebouwde autoscaling (op basis van metrische gegevens zoals het aantal invocaties of CPU-gebruik) schaalt automatisch de inferentiecapaciteit proportioneel met de vraag, wat voldoet aan de vereisten voor onvoorspelbare pieken. De andere opties zijn minder optimaal: ECS met scheduled scaling is niet geschikt voor onvoorspelbare pieken; EKS met de SageMaker Operator en horizontal pod autoscaling is een complexere setup die niet de directe integratie en beheervoordelen van SageMaker biedt voor dit specifieke gebruiksscenario; Spot Instances zijn niet geschikt voor workloads die minimale latentie en hoge beschikbaarheid vereisen vanwege hun onderbrekende aard.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig