Specjalista ds. danych trenuje duży model PyTorch w SageMaker; każde zadanie treningowe trwa około 10 godzin. Podejrzewa, że trening nie zbiega się, a wykorzystanie GPU może być niskie. Które podejście wymaga najmniejszego wysiłku rozwojowego, aby wykryć i rozwiązać te problemy z treningiem?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj wbudowanych reguł SageMaker Debugger, takich jak vanishing_gradient i LowGPUUtilization, aby wykryć problemy i wywołać akcję StopTrainingJob..
Dlaczego to jest odpowiedź
Prawidłowa odpowiedź to użycie wbudowanych reguł SageMaker Debugger, takich jak vanishinggradient i LowGPUUtilization. SageMaker Debugger jest zaprojektowany specjalnie do monitorowania i debugowania zadań treningowych w SageMaker. Reguła vanishinggradient (zanikający gradient) bezpośrednio wykrywa problemy ze zbieżnością, a LowGPUUtilization (niskie wykorzystanie GPU) identyfikuje nieefektywne wykorzystanie zasobów. Te reguły można łatwo skonfigurować do automatycznego zatrzymywania zadania treningowego (StopTrainingJob), co minimalizuje wysiłek rozwojowy. Opcja z metrykami CPU w CloudWatch jest nieodpowiednia, ponieważ problem dotyczy GPU i zbieżności modelu, a nie wykorzystania CPU. Publikowanie niestandardowych metryk i używanie funkcji Lambda wymaga znacznie większego wysiłku rozwojowego i utrzymania. Reguły confusion i featureimportanceoverweight nie są przeznaczone do wykrywania problemów z zanikającym gradientem ani niskim wykorzystaniem GPU.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana