FinCorp gestisce una pipeline di rilevamento frodi in AWS. Hai creato più SageMaker Feature Groups con l'offline store abilitato per rendere persistenti i valori delle feature storiche su S3. Gli scienziati dei dati devono generare dataset di training che uniscano i record delle transazioni (CSV in S3 con un transaction_timestamp) ai valori corretti delle feature storiche al momento di ogni transazione utilizzando SQL in Athena. Quale configurazione e passaggio consentiranno in modo affidabile join performanti e corretti sui timestamp delle feature storiche per esportazioni di training di grandi dimensioni?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Quando crei ogni FeatureGroup, abilita l'offline store con DataCatalogConfig (tabella Glue) che punta al prefisso S3 dove si trovano i file parquet offline. Assicurati che il FeatureGroup sia configurato con record_identifier_column e event_time_feature_name. Assegna al ruolo di training i permessi di lettura per Glue e S3, quindi scrivi SQL Athena che unisce la tua tabella delle transazioni alla tabella Glue del FeatureGroup usando la chiave primaria e event_time <= transaction_timestamp con un'appropriata eliminazione delle partizioni..
Perché questa è la risposta
L'opzione corretta descrive il metodo raccomandato per creare dataset di training storici accurati con SageMaker Feature Store. Abilitando l'offline store con DataCatalogConfig e specificando recordidentifiercolumn ed eventtimefeaturename, si crea una tabella Glue che punta ai dati Parquet in S3. Questo permette di usare Athena per eseguire join temporali efficienti tra le transazioni e i valori storici delle feature, utilizzando eventtime <= transactiontimestamp per recuperare lo stato delle feature al momento di ogni transazione. I permessi di lettura per Glue e S3 sono essenziali. Le altre opzioni sono meno adatte: L'online store non è progettato per esportazioni di training di grandi dimensioni e GetRecord non supporta il recupero di valori storici per un timestamp specifico. SageMaker Batch Transform non è il metodo ideale per unire dati storici complessi basati su timestamp, e l'API featurestore-runtime è per l'online store, non per dati storici offline. Un Glue crawler può creare tabelle, ma non gestisce automaticamente la logica complessa dei join temporali e delle partizioni come fa DataCatalogConfig integrato con Feature Store per query performanti.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta