Specjalista posiada bardzo duży zbiór danych treningowych w S3 (miliony rekordów). Chce uniknąć kopiowania wszystkich danych na wolumin EBS o pojemności 5 GB w notebooku SageMaker, ale nadal trenować na kompletnym zbiorze danych. Który przepływ pracy umożliwia wykorzystanie pełnego zbioru danych do trenowania przy minimalnym lokalnym kopiowaniu?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj małego podzbioru danych w notebooku do walidacji kodu treningowego, a następnie uruchom zadanie treningowe SageMaker, które odczytuje pełny zbiór danych S3 w trybie wejścia Pipe..
Dlaczego to jest odpowiedź
Prawidłowa odpowiedź pozwala na efektywne wykorzystanie pełnego zbioru danych bez kopiowania go w całości do środowiska notebooka. Trenowanie na małym podzbiorze w notebooku służy do szybkiej walidacji kodu. Następnie, zadanie treningowe SageMaker z trybem wejścia Pipe umożliwia strumieniowe przesyłanie danych bezpośrednio z S3 do instancji treningowej, eliminując potrzebę lokalnego przechowywania całego zbioru danych. Pozostałe opcje są mniej optymalne: Uruchomienie instancji EC2 z Deep Learning AMI i podłączenie zasobnika S3 jest możliwe, ale wymaga ręcznego zarządzania infrastrukturą i nie wykorzystuje w pełni możliwości SageMaker w zakresie zarządzania zadaniami treningowymi. Użycie AWS Glue do testowania kompatybilności jest niepotrzebnym krokiem, ponieważ SageMaker jest już zintegrowany z S3 i może bezpośrednio przetwarzać dane. Trenowanie na instancji EC2 zamiast SageMaker po walidacji kodu w notebooku oznacza rezygnację z wielu korzyści oferowanych przez SageMaker, takich jak automatyczne skalowanie, monitorowanie i zarządzanie cyklem życia modelu.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana