Firma medialna potrzebuje rekomendacji artykułów o niskim opóźnieniu dla czytelników w jednym mieście. Ruch sieciowy osiąga szczyty w przewidywalnych godzinach (rano, lunch, po pracy), a poza tym jest niewielki. Odpowiedzi wnioskowania są mniejsze niż 4 MB. Która opcja wdrożenia minimalizuje opóźnienia i jest najbardziej opłacalna?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Serverless inference z provisioned concurrency w celu zminimalizowania opóźnień zimnego startu..
Dlaczego to jest odpowiedź
Serverless inference z provisioned concurrency jest najbardziej opłacalnym i niskolatencyjnym rozwiązaniem. Provisioned concurrency eliminuje zimne starty, zapewniając szybkie odpowiedzi, co jest kluczowe dla rekomendacji w czasie rzeczywistym. Model serverless automatycznie skaluje się w górę i w dół, co jest idealne dla przewidywalnych, ale zmiennych wzorców ruchu, minimalizując koszty, ponieważ płacisz tylko za faktyczne użycie. Real-time inference endpoint z automatycznym skalowaniem może być droższy ze względu na utrzymywanie instancji w gotowości. Asynchronous inference i Batch transform jobs wprowadzają zbyt duże opóźnienia, ponieważ nie są przeznaczone do rekomendacji w czasie rzeczywistym.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana