FinCorp uruchamia potok wykrywania oszustw w AWS. Utworzono wiele SageMaker Feature Groups z włączonym offline store, aby utrwalić historyczne wartości cech w S3. Analitycy danych muszą generować zestawy danych treningowych, które łączą rekordy transakcji (CSV w S3 z transaction_timestamp) z poprawnymi historycznymi wartościami cech z każdego czasu transakcji, używając SQL w Athena. Jaka konfiguracja i krok niezawodnie umożliwi wydajne, poprawne łączenie historycznych sygnatur czasowych cech dla dużych eksportów treningowych?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Podczas tworzenia każdego FeatureGroup, włącz offline store z DataCatalogConfig (tabela Glue) wskazującym na prefiks S3, gdzie lądują pliki parquet offline. Upewnij się, że FeatureGroup jest skonfigurowany z record_identifier_column i event_time_feature_name. Nadaj roli treningowej uprawnienia do odczytu Glue i S3, a następnie napisz zapytanie Athena SQL, które łączy tabelę transakcji z tabelą FeatureGroup Glue, używając klucza podstawowego i event_time <= transaction_timestamp z odpowiednim przycinaniem partycji..
Dlaczego to jest odpowiedź
Poprawna odpowiedź umożliwia efektywne łączenie historycznych danych cech z danymi transakcyjnymi w Athena. Włączenie offline store z DataCatalogConfig tworzy tabelę Glue, która reprezentuje dane cech w S3, co pozwala na zapytania SQL. Kluczowe jest skonfigurowanie recordidentifiercolumn i eventtimefeaturename, ponieważ te pola są używane do prawidłowego łączenia danych. Zapytanie SQL z warunkiem eventtime <= transactiontimestamp i przycinaniem partycji zapewnia, że dla każdej transakcji pobierane są tylko historyczne wartości cech, co jest kluczowe dla prawidłowego treningu modeli. Uprawnienia do Glue i S3 są niezbędne do odczytu danych. Pozostałe opcje są nieprawidłowe: Zachowanie tylko online store jest nieefektywne dla dużych zestawów danych treningowych ze względu na limity przepustowości i opóźnienia pojedynczych wywołań GetRecord. Użycie SageMaker Batch Transform do wywoływania API featurestore-runtime jest również nieefektywne i kosztowne dla dużych zbiorów danych historycznych, ponieważ online store jest przeznaczony do pobierania pojedynczych rekordów w czasie rzeczywistym, a nie do masowego eksportu historycznego. Konfiguracja Glue crawlera bez DataCatalogConfig podczas tworzenia FeatureGroup nie zapewni optymalnej struktury tabeli dla zapytań historycznych i może prowadzić do nieprawidłowego wnioskowania schematu lub partycjonowania.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana