Firma zajmująca się mediami społecznościowymi będzie trenować model klasyfikacji obrazów (używając wbudowanego klasyfikatora obrazów SageMaker) do wykrywania obraźliwych treści. Użyją trybu pipe, aby przyspieszyć trenowanie. Zbiór danych jest podzielony na foldery Training, Validation i Test, z podfolderami klas, obrazy są jednolicie zmienione, a dwa pliki manifestu noszą nazwy training.lst i validation.lst. Utworzyli oddzielne zasobniki S3 dla przesyłania danych treningowych i walidacyjnych. Jaki dodatkowy krok przygotowania danych powinni wykonać przed przesłaniem do S3?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Konwertuj manifesty na pliki RecordIO (training.rec i validation.rec) za pomocą narzędzia im2rec z Apache MXNet, a następnie prześlij pliki RecordIO do zasobnika S3 przeznaczonego do trenowania..
Dlaczego to jest odpowiedź
Prawidłowa odpowiedź to konwersja manifestów na pliki RecordIO za pomocą narzędzia im2rec. Wbudowany klasyfikator obrazów SageMaker, szczególnie w trybie pipe, najlepiej współpracuje z formatem RecordIO. Ten format optymalizuje przesyłanie danych i zwiększa wydajność treningu, ponieważ pakuje wiele obrazów i ich etykiet do jednego pliku, co zmniejsza narzut związany z operacjami I/O. Pozostałe opcje są nieprawidłowe, ponieważ: Użycie Pandas DataFrame i plików Parquet nie jest natywnie obsługiwane ani zoptymalizowane dla wbudowanego klasyfikatora obrazów SageMaker w trybie pipe. Kompresja katalogów za pomocą Snappy lub gzip, a następnie przesyłanie ich wraz z plikami manifestu, nie tworzy formatu RecordIO, który jest wymagany do optymalnego działania trybu pipe.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana