Un'azienda ospita più modelli SageMaker in tempo reale che richiedono istanze accelerate e hanno diverse esigenze di scalabilità. I cold start devono essere prevenuti per ogni modello. Quale design soddisfa questi vincoli?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Creare un endpoint SageMaker, aggiungere un componente di inferenza per ogni modello che punta a tale endpoint, configurare l'auto scaling per componente di inferenza e impostare il numero minimo di copie ad almeno 1..
Perché questa è la risposta
La risposta corretta è creare un endpoint SageMaker, aggiungere un componente di inferenza per ogni modello che punta a tale endpoint, configurare l'auto scaling per componente di inferenza e impostare il numero minimo di copie ad almeno 1. Questo approccio consente di consolidare più modelli su un unico endpoint, riducendo i costi e la complessità di gestione. L'auto scaling per componente di inferenza garantisce che ogni modello possa scalare in base alle proprie esigenze, mentre l'impostazione di un numero minimo di copie ad almeno 1 previene i cold start. Le altre opzioni non soddisfano tutti i requisiti: Gli endpoint Serverless Inference non supportano istanze accelerate (GPU) e, sebbene la concorrenza provisioned riduca i cold start, non è l'ideale per le GPU. Gli endpoint Asynchronous Inference sono progettati per carichi di lavoro batch o con latenza tollerabile, non per inferenze in tempo reale. L'opzione con il bucket S3 e un endpoint multi-model generico non offre la granularità di scaling e la prevenzione dei cold start per ogni modello come richiesto, poiché lo scaling è a livello di endpoint, non di singolo modello.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta