FinCorp betreibt eine Pipeline zur Betrugserkennung in AWS. Sie haben mehrere SageMaker Feature Groups mit aktiviertem Offline-Store erstellt, um historische Feature-Werte in S3 zu speichern. Data Scientists müssen Trainingsdatensätze generieren, die Transaktionsdatensätze (CSV in S3 mit einem transaction_timestamp) mit den korrekten historischen Feature-Werten zum Zeitpunkt jeder Transaktion mithilfe von SQL in Athena verbinden. Welche Konfiguration und welcher Schritt ermöglichen zuverlässig performante, korrekte Joins auf historische Feature-Zeitstempel für große Trainingsexporte?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Aktivieren Sie beim Erstellen jeder FeatureGroup den Offline-Store mit DataCatalogConfig (Glue-Tabelle), die auf das S3-Präfix verweist, in dem die Offline-Parquet-Dateien landen. Stellen Sie sicher, dass die FeatureGroup mit record_identifier_column und event_time_feature_name konfiguriert ist. Geben Sie der Trainingsrolle Glue- und S3-Leseberechtigungen und schreiben Sie dann Athena-SQL, das Ihre Transaktionstabelle mit der FeatureGroup Glue-Tabelle unter Verwendung des Primärschlüssels und event_time <= transaction_timestamp mit entsprechender Partitionsbereinigung verbindet..
Warum dies die Antwort ist
Die korrekte Antwort beschreibt den empfohlenen Weg, historische Features für große Trainingsdatensätze aus dem SageMaker Feature Store abzurufen. Das Aktivieren des Offline-Stores mit DataCatalogConfig erstellt eine Glue-Tabelle, die auf die Parquet-Dateien in S3 verweist, was effiziente SQL-Abfragen mit Athena ermöglicht. Die Konfiguration von recordidentifiercolumn und eventtimefeaturename ist entscheidend für zeitpunktgenaue Joins. Die Verwendung von Athena-SQL mit dem Primärschlüssel und der Bedingung eventtime <= transactiontimestamp gewährleistet die korrekte Verknüpfung historischer Feature-Werte zum Zeitpunkt jeder Transaktion, während die Partitionsbereinigung die Performance optimiert. Die Option, nur den Online-Store zu verwenden und GetRecord-Aufrufe durchzuführen, ist für große Datensätze ineffizient und teuer. SageMaker Batch Transform mit der featurestore-runtime API ist nicht für zeitpunktgenaue historische Joins über große Datensätze konzipiert, da es primär den aktuellen Zustand abruft. Die Konfiguration eines Glue-Crawlers ohne DataCatalogConfig ist unzuverlässig, da der Crawler möglicherweise nicht die notwendigen Metadaten für eventtime-basierte Joins korrekt ableitet und die Performance nicht garantiert ist.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich