FinInsights ha implementato un endpoint del modello di base JumpStart per la generazione di testo finanziario a bassa latenza su un'istanza ml.g5.xlarge. Dopo un progetto pilota di successo, necessitano di un throughput sostenuto 3 volte superiore con un comportamento della latenza di coda simile. Qual è la modifica più diretta e supportata all'endpoint SageMaker JumpStart per soddisfare questo requisito?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Aggiornare la configurazione dell'endpoint SageMaker per utilizzare un tipo di istanza GPU più grande (ad esempio, ml.g5.12xlarge) o passare a più istanze ml.g5.xlarge dietro l'endpoint (aumentare il conteggio delle istanze) e abilitare l'autoscaling dell'endpoint. Ridistribuire il modello utilizzando la stessa immagine container JumpStart e la nuova configurazione dell'endpoint..
Perché questa è la risposta
La risposta corretta è la più diretta e supportata per aumentare il throughput mantenendo una latenza simile. L'aumento delle dimensioni dell'istanza (scaling up) o del numero di istanze (scaling out) fornisce più risorse di calcolo (GPU e CPU) per elaborare più richieste contemporaneamente, soddisfacendo il requisito di throughput 3 volte superiore. L'autoscaling garantisce che le risorse si adattino dinamicamente al carico. Le opzioni errate sono: Creare un HyperParameterTuningJob non è rilevante per aumentare il throughput di un modello già distribuito. Serve per ottimizzare i parametri del modello, non l'infrastruttura di inferenza. Gli acceleratori Elastic Inference sono progettati per accelerare i modelli su istanze CPU o istanze GPU più piccole, non per aumentare significativamente il throughput su istanze GPU già performanti come le ml.g5.xlarge, e non garantiscono un aumento di 3x. SageMaker Serverless Inference è ottimo per carichi di lavoro variabili e a bassa frequenza, ma potrebbe non essere la soluzione ottimale per un throughput sostenuto 3 volte superiore con requisiti di bassa latenza di coda, poiché introduce una latenza di avvio a freddo e potrebbe non offrire lo stesso controllo sulle prestazioni delle istanze dedicate.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta