Un'azienda di media necessita di raccomandazioni di articoli a bassa latenza per i lettori di una città. Il traffico raggiunge il picco in orari prevedibili (mattina, pranzo, dopo il lavoro) ed è leggero negli altri momenti. Le risposte di inferenza sono inferiori a 4 MB. Quale opzione di deployment minimizza la latenza ed è più conveniente?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Inferenza serverless con concorrenza provisioned per minimizzare la latenza di cold-start..
Perché questa è la risposta
L'inferenza serverless con concorrenza provisioned è la soluzione più conveniente e a bassa latenza per questo scenario. La concorrenza provisioned elimina i cold start, garantendo risposte rapide anche durante i picchi di traffico. Essendo serverless, l'azienda paga solo per le risorse effettivamente utilizzate, il che è ideale per carichi di lavoro variabili con picchi prevedibili e periodi di bassa attività, minimizzando i costi quando il traffico è leggero. L'endpoint di inferenza in tempo reale con auto scaling potrebbe essere più costoso perché le istanze potrebbero rimanere attive più a lungo del necessario. L'inferenza asincrona e i job di trasformazione batch introducono latenza, rendendoli inadatti per raccomandazioni in tempo reale.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta