Zespół e-commerce trenuje duży model klasyfikacji obrazów z 10 000 klasami w wielu iteracjach treningowych. Muszą zminimalizować narzut operacyjny i koszty, jednocześnie unikając utraty pracy i ponownego trenowania. Które podejście najlepiej spełnia te potrzeby?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj zarządzanego treningu spot SageMaker i włącz checkpointing podczas uruchamiania zadań treningowych..
Dlaczego to jest odpowiedź
Trening zarządzany przez SageMaker Spot z włączonym checkpointingiem jest najlepszym rozwiązaniem, ponieważ minimalizuje narzut operacyjny i koszty, jednocześnie zapewniając odporność na przerwania. SageMaker automatycznie zarządza instancjami Spot i wznawia trening od ostatniego punktu kontrolnego w przypadku przerwania, zapobiegając utracie pracy. AWS Batch z instancjami Spot wymaga większego zarządzania i konfiguracji odzyskiwania po przerwaniu. Użycie samych instancji Spot EC2 wymaga ręcznego zarządzania przerwaniami i zapisywaniem migawek, co zwiększa złożoność. AWS Lambda nie jest odpowiednia do długotrwałego treningu dużych modeli ze względu na ograniczenia czasu wykonania i pamięci.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana