Ein Unternehmen trainiert Modelle in SageMaker unter Verwendung von 200 TB Daten, die in S3 gespeichert sind. Der Datensatz besteht aus vielen Dateien, von denen jede größer als 200 MB ist. Das Unternehmen möchte die schnellste Verarbeitungszeit bei minimalem Einrichtungsaufwand. Welche Datenzugriffsmethode sollte es verwenden?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie den SageMaker FastFile mode, um die Dateien bei Bedarf von S3 zu streamen..
Warum dies die Antwort ist
Der SageMaker FastFile-Modus (auch als Pipe-Modus bekannt) streamt Daten direkt von S3 zu den Trainingsinstanzen, was die schnellste Verarbeitungszeit für große Datensätze mit vielen großen Dateien bietet, da das Herunterladen des gesamten Datensatzes vor dem Training entfällt. Dies minimiert auch den Einrichtungsaufwand. Der SageMaker File-Modus kopiert den gesamten Datensatz vor dem Training, was bei 200 TB sehr zeitaufwändig wäre. Amazon FSx for Lustre ist eine leistungsstarke Option, erfordert aber mehr Einrichtungs- und Verwaltungskosten. Amazon EFS ist für diesen Anwendungsfall nicht optimiert, da es höhere Latenzzeiten und geringeren Durchsatz als FSx for Lustre oder der FastFile-Modus für große, sequenzielle Lesezugriffe aufweist.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich