Un endpoint SageMaker in tempo reale di produzione che esegue il modello di rilevamento oggetti integrato su un'istanza P3 mostra un basso utilizzo della GPU. Quale modifica alla distribuzione consentirà di utilizzare al meglio le risorse di inferenza allocate?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Ridistribuire il modello su un'istanza M5 e collegare gli acceleratori Amazon Elastic Inference..
Perché questa è la risposta
La risposta corretta è ridistribuire il modello su un'istanza M5 e collegare gli acceleratori Amazon Elastic Inference. Le istanze P3 sono costose e ottimizzate per il training, non per l'inferenza a basso utilizzo. Gli acceleratori Amazon Elastic Inference (EI) sono progettati per accelerare l'inferenza a basso costo, consentendo di collegare la giusta quantità di accelerazione GPU a istanze CPU come M5, riducendo i costi e aumentando l'utilizzo delle risorse. Eseguire il modello come processo di trasformazione batch su un'istanza M5 non è una soluzione per un endpoint in tempo reale. Spostare la distribuzione su un'istanza P3dn aumenterebbe ulteriormente i costi e non risolverebbe il problema del basso utilizzo della GPU. Ospitare il modello su un cluster Amazon ECS con un'istanza P3 non risolve il problema del basso utilizzo della GPU dell'istanza P3 stessa per l'inferenza.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta