FinCorp gère un pipeline de détection de fraude dans AWS. Vous avez créé plusieurs SageMaker Feature Groups avec le magasin hors ligne activé pour persister les valeurs de caractéristiques historiques dans S3. Les scientifiques des données doivent générer des ensembles de données d'entraînement qui joignent les enregistrements de transactions (CSV dans S3 avec un transaction_timestamp) aux valeurs de caractéristiques historiques correctes à la date de chaque transaction en utilisant SQL dans Athena. Quelle configuration et quelle étape permettront des jointures performantes et correctes sur les horodatages des caractéristiques historiques pour les exportations d'entraînement volumineuses ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Lors de la création de chaque FeatureGroup, activez le magasin hors ligne avec DataCatalogConfig (table Glue) pointant vers le préfixe S3 où les fichiers parquet hors ligne sont stockés. Assurez-vous que le FeatureGroup est configuré avec record_identifier_column et event_time_feature_name. Donnez au rôle d'entraînement les permissions de lecture Glue et S3, puis écrivez du SQL Athena qui joint votre table de transactions à la table Glue du FeatureGroup en utilisant la clé primaire et event_time <= transaction_timestamp avec une élagage de partition approprié..
Pourquoi c'est la réponse
L'option correcte décrit la méthode standard et performante pour joindre des données transactionnelles à des caractéristiques historiques dans SageMaker Feature Store pour la création d'ensembles d'entraînement. L'activation du magasin hors ligne avec DataCatalogConfig crée une table Glue Data Catalog, permettant à Athena d'interroger directement les données Parquet stockées dans S3. La configuration de recordidentifiercolumn et eventtimefeaturename est cruciale pour que Feature Store gère correctement les versions des caractéristiques. L'utilisation d'une jointure SQL avec eventtime <= transactiontimestamp et l'élagage de partition garantissent que seules les caractéristiques valides au moment de la transaction sont sélectionnées, optimisant les performances pour les grands ensembles de données. Les autres options sont incorrectes car : L'utilisation du magasin en ligne avec GetRecord pour chaque transaction est inefficace et coûteuse pour la création d'ensembles d'entraînement volumineux. SageMaker Batch Transform est destiné à l'inférence par lots, pas à la création d'ensembles d'entraînement en joignant des données historiques. Un crawler Glue peut inférer des schémas, mais ne gère pas automatiquement la logique de versionnement des caractéristiques basée sur eventtime comme le fait Feature Store avec sa configuration DataCatalogConfig.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise