Ein Spezialist verfügt über einen sehr großen Trainingsdatensatz in S3 (Millionen von Datensätzen). Er möchte vermeiden, alle Daten auf das 5 GB große EBS-Volume eines SageMaker-Notebooks zu kopieren, aber dennoch mit dem vollständigen Datensatz trainieren. Welcher Workflow ermöglicht die Verwendung des vollständigen Datensatzes für das Training mit minimalem lokalen Kopieren?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie eine kleine Untermenge von Daten auf dem Notebook, um den Trainingscode zu validieren, und starten Sie dann einen SageMaker-Trainingsjob, der den vollständigen S3-Datensatz im Pipe-Eingabemodus liest..
Warum dies die Antwort ist
Die Verwendung einer kleinen Untermenge von Daten auf dem Notebook zur Validierung des Trainingscodes ist eine effiziente Methode, um die Logik zu testen, ohne große Datenmengen herunterladen zu müssen. Anschließend ermöglicht ein SageMaker-Trainingsjob im Pipe-Eingabemodus das direkte Streamen der Daten aus S3 zum Trainingscontainer, ohne dass die gesamten Daten auf das lokale Volume kopiert werden müssen. Dies ist ideal für sehr große Datensätze. Die Option mit der EC2-Instance und dem Deep Learning AMI erfordert mehr manuellen Aufwand und Konfiguration als ein SageMaker-Trainingsjob. AWS Glue ist ein ETL-Dienst und nicht primär für das Training von Machine-Learning-Modellen gedacht. Die letzte Option, die nach der Validierung auf eine EC2-Instance wechselt, ist ebenfalls umständlicher und bietet nicht die Vorteile des Pipe-Modus von SageMaker.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich