Un endpoint SageMaker che esegue il modello Image Classification integrato su un'istanza ml.m5.xlarge sta riscontrando una latenza di inferenza inaccettabile e ModelLatency è il fattore dominante. La latenza peggiora quando più utenti chiamano l'endpoint contemporaneamente. Quale azione ridurrà la latenza di inferenza per questi ricercatori?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Collegare un acceleratore Amazon Elastic Inference (ad esempio, un ml.eia2.medium) all'istanza dell'endpoint..
Perché questa è la risposta
La risposta corretta è collegare un acceleratore Amazon Elastic Inference (EI). Gli acceleratori EI sono progettati specificamente per accelerare l'inferenza di deep learning su istanze CPU o GPU esistenti, riducendo la latenza e i costi. Poiché il problema è l'inaccettabile latenza di inferenza, specialmente con più utenti, un acceleratore EI può scaricare parte del carico di calcolo, migliorando le prestazioni. Cambiare l'istanza con un'istanza burstable ml.t3 non risolverebbe il problema, poiché le istanze burstable sono pensate per carichi di lavoro a basso utilizzo con picchi occasionali e potrebbero peggiorare la latenza sotto carico sostenuto. SageMaker Autopilot è per l'ottimizzazione automatica del modello durante l'addestramento, non per la riduzione della latenza di inferenza su un endpoint esistente. Cambiare il tipo di istanza con uno ottimizzato per la memoria non è la soluzione diretta per la latenza di inferenza, che è tipicamente legata alla potenza di calcolo (CPU/GPU) e non alla memoria.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta